Raízen

SRE Sênior

🌍 Remoto📍 São Paulo
PUBLICIDADE

Descrição da Vaga

A Raízen busca um(a) SRE Sênior para atuar na sustentação, evolução e confiabilidade de plataformas críticas, com forte foco em observabilidade, monitoramento e automação de ambientes cloud e Kubernetes. Esta posição terá um papel estratégico na evolução das práticas de SRE e na construção de uma operação cada vez mais resiliente, escalável e orientada a dados.

Responsabilidades

  • Apoiar ambientes distribuídos em Azure e AWS, atuando diretamente na evolução da observabilidade corporativa utilizando ferramentas como Grafana, Prometheus, OpenTelemetry, Loki, Tempo e Zabbix.
  • Apoiar iniciativas relacionadas à monitoração de aplicações, infraestrutura, logs, métricas e tracing distribuído.
  • Realizar troubleshooting de ambientes críticos, análise de incidentes, definição de dashboards, alertas e indicadores operacionais.
  • Atuar próximo aos times de desenvolvimento, arquitetura e infraestrutura para garantir qualidade, disponibilidade e performance das aplicações.
  • Atuar na evolução das práticas de automação, GitOps, monitoramento de ambientes Kubernetes (AKS/EKS) e melhoria contínua da plataforma, sempre considerando governança, segurança, eficiência operacional e experiência dos times internos.
PUBLICIDADE

Requisitos

  • Formação superior completa.
  • Sólida experiência com observabilidade e monitoramento de ambientes críticos, utilizando ferramentas como Grafana, Prometheus, Zabbix, OpenTelemetry ou similares.
  • Experiência em troubleshooting e análise de causa raiz (RCA) em ambientes distribuídos e de alta disponibilidade.
  • Conhecimento avançado em Kubernetes, preferencialmente em ambientes AKS (Azure Kubernetes Service) e/ou EKS (Amazon Elastic Kubernetes Service).
  • Experiência com provedores de cloud pública, especialmente Azure e/ou AWS.
  • Vivência com monitoramento de aplicações, incluindo coleta e análise de logs, métricas e traces.
  • Conhecimentos sólidos em sistemas Linux, containers e Docker.
  • Experiência com infraestrutura de redes, DNS, Load Balancers, conectividade e troubleshooting de rede.
  • Capacidade de desenvolver automações e scripts utilizando Bash, PowerShell e/ou Python.
  • Experiência com práticas de GitOps, CI/CD e operação de plataformas modernas orientadas à observabilidade.
  • Experiência na construção, manutenção e otimização de pipelines utilizando GitHub Actions.
  • Experiência com stack de observabilidade baseada em Grafana, incluindo Loki, Tempo, Mimir e Prometheus.
  • Conhecimento das práticas e princípios de Site Reliability Engineering (SRE), incluindo definição e acompanhamento de SLI, SLO e Error Budgets.
  • Experiência com ArgoCD para gestão de deploys e GitOps.
  • Conhecimento em FinOps e estratégias de otimização de custos em ambientes cloud.
  • Experiência com Terraform e práticas de Infrastructure as Code (IaC).
  • Vivência em ambientes híbridos e multi-cloud.
  • Experiência com plataformas de observabilidade corporativa, como Dynatrace, Datadog ou New Relic.
  • Experiência com Argo Workflows e Argo Events.
  • Conhecimento em Service Mesh, especialmente Istio ou soluções similares.
  • Vivência com iniciativas de AIOps, automação inteligente e correlação de eventos.
  • Conhecimento em Terragrunt e Crossplane para gestão avançada de infraestrutura.
  • Experiência na definição e implementação de padrões de confiabilidade, resiliência e escalabilidade em plataformas críticas.

Somos uma empresa integrada de energia. Uma verdadeira potência verde. Referência global em bioenergia, somos protagonistas na transição energética e estamos redefinindo o futuro da energia. Estamos entre os maiores grupos empresariais privados do Brasil e nosso time é nosso maior diferencial: mais...[Ver Mais]

Informações Adicionais

Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"
PUBLICIDADE
Candidatar-se a esta vaga →

Você será redirecionado para o site da empresa

PUBLICIDADE