Descrição da Vaga
Como Site Reliability Engineer (SRE) na Dataside, você será o ponto focal técnico para garantir a confiabilidade, disponibilidade, performance e segurança dos serviços em produção. Sua atuação será na prevenção e resposta a incidentes críticos, além da evolução contínua da operação. Este papel envolve liderar e executar práticas de SRE, como observabilidade, SLI/SLO, post-mortem, automação e governança de mudanças, garantindo a estabilidade dos sistemas em AWS. Além disso, você irá orientar tecnicamente o time, disseminando boas práticas e elevando o padrão operacional.
Responsabilidades
- Ser referência técnica e atuar como ponto focal em incidentes críticos e War Rooms, coordenando ações, mitigação e comunicação.
- Implementar e evoluir práticas de SRE: definição e acompanhamento de SLI/SLO, gestão de error budget e melhoria contínua baseada em dados.
- Realizar análise de tendências (incidentes recorrentes, gargalos, alertas ruidosos) para ações preventivas e redução estrutural de riscos.
- Conduzir e revisar GMUDs complexas com visão estratégica de impacto no negócio, riscos, rollback e validação pós-mudança.
- Acompanhar, revisar e evoluir os processos de observabilidade (métricas, logs e traces), garantindo dashboards acionáveis, alertas bem calibrados (redução de ruído), priorização e classificação de eventos.
- Atuar no desenho e melhoria de confiabilidade de workloads em AWS, com foco em ECS Fargate (deploy, escalabilidade, capacidade, tuning e troubleshooting), Rede AWS (VPC, conectividade, segurança e desempenho) e Mensageria (RabbitMQ/AmazonMQ) (saúde, filas, throughput, latência e padrões de falha).
- Criar e manter runbooks/playbooks, padronizando resposta a incidentes e reduzindo MTTR.
- Orientar e apoiar tecnicamente profissionais juniores e plenos, promovendo excelência operacional.
- Identificar oportunidades de automação (scripts, pipelines, padronizações) para ganho de eficiência e redução de falhas humanas.
- Participar de decisões arquiteturais junto às áreas técnicas (Dev, Infra, Arquitetura), influenciando escolhas com foco em confiabilidade.
- Garantir alinhamento com stakeholders e gestão de crises com clareza, agilidade e transparência.
Requisitos
- ✓Sólida experiência com operação/sustentação de ambientes críticos e alta disponibilidade.
- ✓Domínio de AWS (serviços essenciais e arquitetura distribuída), com foco em VPC / Redes, IAM, Load Balancer (ALB/NLB) e CloudWatch (e serviços correlatos).
- ✓Experiência com mensageria: RabbitMQ e/ou AmazonMQ (idealmente ambos).
- ✓Conhecimento forte em rede (conceitos e prática em cloud): subnets, rotas, SG/NACL, DNS, conectividade e troubleshooting.
- ✓Experiência com ferramentas de monitoramento/observabilidade (Datadog, Prometheus, OpenTelemetry, Zabbix, Grafana, CloudWatch).
- ✓Forte habilidade em troubleshooting de infraestrutura, redes e sistemas em produção.
- ✓Experiência com Linux.
- ✓Conhecimentos em bancos de dados relacionais (MySQL, PostgreSQL) para apoio em análise e diagnóstico.
- ✓Perfil de liderança técnica, proatividade e excelente comunicação para atuação em crise.
- ✓Participação em projetos de automação, confiabilidade, observabilidade ou SRE.
- ✓Vivência com governança de mudanças (GMUD/Change Management) e operação orientada a processos.
- •Experiência com Infra as Code (Terraform / CloudFormation).
- •Experiência com CI/CD (GitHub Actions, GitLab CI, Jenkins ou similares).
- •Experiência com containers e orquestração (Kubernetes/EKS), além de ECS.
- •Conhecimentos em microserviços e mensageria adicional (Kafka, SQS, SNS).
- •Certificação ITIL v4.
- •Certificações em cloud (AWS, Azure ou GCP).
- ✓Disponibilidade para atuação em janelas de mudança e suporte em cenários críticos (quando necessário).
Benefícios
- ✓Auxílio médico (ajuda de custo mensal para apoiar na contratação do seu plano de saúde).
- ✓Wellhub.
- ✓Terapia online 100% custeada pela empresa.
- ✓Atendimento em nutrição online, com até 2 consultas mensais.
- ✓Seguro de vida com apólice no valor de R$ 125 mil.
- ✓Day off no aniversário.
- ✓Descanso remunerado.
- ✓Gamificação interna.
- ✓Parcerias educacionais com faculdades como FIAP, Anhanguera e Instituto Infnet.
- ✓Bônus por certificação técnica.
Categorias
Sobre a Empresa
Mais vagas na Dataside →A missão da Dataside é acompanhar as empresas na jornada de dados, aumentando a confiabilidade e agilidade na tomada de decisão orientada a dados e IA. Advanced Analytics & AI Criamos soluções envolvendo Engenharia de Dados, Machine Learning e IA.[Ver Mais]
Informações Adicionais
Você será redirecionado para o site da empresa