Dataside

Site Reliability Engineer (SRE)

🌍 Remoto📍 Remoto
PUBLICIDADE

Descrição da Vaga

Como Site Reliability Engineer (SRE) na Dataside, você será o ponto focal técnico para garantir a confiabilidade, disponibilidade, performance e segurança dos serviços em produção. Sua atuação será na prevenção e resposta a incidentes críticos, além da evolução contínua da operação. Este papel envolve liderar e executar práticas de SRE, como observabilidade, SLI/SLO, post-mortem, automação e governança de mudanças, garantindo a estabilidade dos sistemas em AWS. Além disso, você irá orientar tecnicamente o time, disseminando boas práticas e elevando o padrão operacional.

Responsabilidades

  • Ser referência técnica e atuar como ponto focal em incidentes críticos e War Rooms, coordenando ações, mitigação e comunicação.
  • Implementar e evoluir práticas de SRE: definição e acompanhamento de SLI/SLO, gestão de error budget e melhoria contínua baseada em dados.
  • Realizar análise de tendências (incidentes recorrentes, gargalos, alertas ruidosos) para ações preventivas e redução estrutural de riscos.
  • Conduzir e revisar GMUDs complexas com visão estratégica de impacto no negócio, riscos, rollback e validação pós-mudança.
  • Acompanhar, revisar e evoluir os processos de observabilidade (métricas, logs e traces), garantindo dashboards acionáveis, alertas bem calibrados (redução de ruído), priorização e classificação de eventos.
  • Atuar no desenho e melhoria de confiabilidade de workloads em AWS, com foco em ECS Fargate (deploy, escalabilidade, capacidade, tuning e troubleshooting), Rede AWS (VPC, conectividade, segurança e desempenho) e Mensageria (RabbitMQ/AmazonMQ) (saúde, filas, throughput, latência e padrões de falha).
  • Criar e manter runbooks/playbooks, padronizando resposta a incidentes e reduzindo MTTR.
  • Orientar e apoiar tecnicamente profissionais juniores e plenos, promovendo excelência operacional.
  • Identificar oportunidades de automação (scripts, pipelines, padronizações) para ganho de eficiência e redução de falhas humanas.
  • Participar de decisões arquiteturais junto às áreas técnicas (Dev, Infra, Arquitetura), influenciando escolhas com foco em confiabilidade.
  • Garantir alinhamento com stakeholders e gestão de crises com clareza, agilidade e transparência.
PUBLICIDADE

Requisitos

  • Sólida experiência com operação/sustentação de ambientes críticos e alta disponibilidade.
  • Domínio de AWS (serviços essenciais e arquitetura distribuída), com foco em VPC / Redes, IAM, Load Balancer (ALB/NLB) e CloudWatch (e serviços correlatos).
  • Experiência com mensageria: RabbitMQ e/ou AmazonMQ (idealmente ambos).
  • Conhecimento forte em rede (conceitos e prática em cloud): subnets, rotas, SG/NACL, DNS, conectividade e troubleshooting.
  • Experiência com ferramentas de monitoramento/observabilidade (Datadog, Prometheus, OpenTelemetry, Zabbix, Grafana, CloudWatch).
  • Forte habilidade em troubleshooting de infraestrutura, redes e sistemas em produção.
  • Experiência com Linux.
  • Conhecimentos em bancos de dados relacionais (MySQL, PostgreSQL) para apoio em análise e diagnóstico.
  • Perfil de liderança técnica, proatividade e excelente comunicação para atuação em crise.
  • Participação em projetos de automação, confiabilidade, observabilidade ou SRE.
  • Vivência com governança de mudanças (GMUD/Change Management) e operação orientada a processos.
  • Experiência com Infra as Code (Terraform / CloudFormation).
  • Experiência com CI/CD (GitHub Actions, GitLab CI, Jenkins ou similares).
  • Experiência com containers e orquestração (Kubernetes/EKS), além de ECS.
  • Conhecimentos em microserviços e mensageria adicional (Kafka, SQS, SNS).
  • Certificação ITIL v4.
  • Certificações em cloud (AWS, Azure ou GCP).
  • Disponibilidade para atuação em janelas de mudança e suporte em cenários críticos (quando necessário).

Benefícios

  • Auxílio médico (ajuda de custo mensal para apoiar na contratação do seu plano de saúde).
  • Wellhub.
  • Terapia online 100% custeada pela empresa.
  • Atendimento em nutrição online, com até 2 consultas mensais.
  • Seguro de vida com apólice no valor de R$ 125 mil.
  • Day off no aniversário.
  • Descanso remunerado.
  • Gamificação interna.
  • Parcerias educacionais com faculdades como FIAP, Anhanguera e Instituto Infnet.
  • Bônus por certificação técnica.

A missão da Dataside é acompanhar as empresas na jornada de dados, aumentando a confiabilidade e agilidade na tomada de decisão orientada a dados e IA.    Advanced Analytics & AI Criamos soluções envolvendo Engenharia de Dados, Machine Learning e IA.[Ver Mais]

Informações Adicionais

Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"
PUBLICIDADE
Candidatar-se a esta vaga →

Você será redirecionado para o site da empresa

PUBLICIDADE