PUBLICIDADE
Descrição da Vaga
A Raízen busca um(a) SRE Sênior para atuar na sustentação, evolução e confiabilidade de plataformas críticas, com forte foco em observabilidade, monitoramento e automação de ambientes cloud e Kubernetes. Esta posição terá um papel estratégico na evolução das práticas de SRE e na construção de uma operação cada vez mais resiliente, escalável e orientada a dados.
Responsabilidades
- Apoiar ambientes distribuídos em Azure e AWS, atuando diretamente na evolução da observabilidade corporativa utilizando ferramentas como Grafana, Prometheus, OpenTelemetry, Loki, Tempo e Zabbix.
- Apoiar iniciativas relacionadas à monitoração de aplicações, infraestrutura, logs, métricas e tracing distribuído.
- Realizar troubleshooting de ambientes críticos, análise de incidentes, definição de dashboards, alertas e indicadores operacionais.
- Atuar próximo aos times de desenvolvimento, arquitetura e infraestrutura para garantir qualidade, disponibilidade e performance das aplicações.
- Atuar na evolução das práticas de automação, GitOps, monitoramento de ambientes Kubernetes (AKS/EKS) e melhoria contínua da plataforma, sempre considerando governança, segurança, eficiência operacional e experiência dos times internos.
PUBLICIDADE
Requisitos
- ✓Formação superior completa.
- ✓Sólida experiência com observabilidade e monitoramento de ambientes críticos, utilizando ferramentas como Grafana, Prometheus, Zabbix, OpenTelemetry ou similares.
- ✓Experiência em troubleshooting e análise de causa raiz (RCA) em ambientes distribuídos e de alta disponibilidade.
- ✓Conhecimento avançado em Kubernetes, preferencialmente em ambientes AKS (Azure Kubernetes Service) e/ou EKS (Amazon Elastic Kubernetes Service).
- ✓Experiência com provedores de cloud pública, especialmente Azure e/ou AWS.
- ✓Vivência com monitoramento de aplicações, incluindo coleta e análise de logs, métricas e traces.
- ✓Conhecimentos sólidos em sistemas Linux, containers e Docker.
- ✓Experiência com infraestrutura de redes, DNS, Load Balancers, conectividade e troubleshooting de rede.
- ✓Capacidade de desenvolver automações e scripts utilizando Bash, PowerShell e/ou Python.
- ✓Experiência com práticas de GitOps, CI/CD e operação de plataformas modernas orientadas à observabilidade.
- ✓Experiência na construção, manutenção e otimização de pipelines utilizando GitHub Actions.
- •Experiência com stack de observabilidade baseada em Grafana, incluindo Loki, Tempo, Mimir e Prometheus.
- •Conhecimento das práticas e princípios de Site Reliability Engineering (SRE), incluindo definição e acompanhamento de SLI, SLO e Error Budgets.
- •Experiência com ArgoCD para gestão de deploys e GitOps.
- •Conhecimento em FinOps e estratégias de otimização de custos em ambientes cloud.
- •Experiência com Terraform e práticas de Infrastructure as Code (IaC).
- •Vivência em ambientes híbridos e multi-cloud.
- •Experiência com plataformas de observabilidade corporativa, como Dynatrace, Datadog ou New Relic.
- •Experiência com Argo Workflows e Argo Events.
- •Conhecimento em Service Mesh, especialmente Istio ou soluções similares.
- •Vivência com iniciativas de AIOps, automação inteligente e correlação de eventos.
- •Conhecimento em Terragrunt e Crossplane para gestão avançada de infraestrutura.
- •Experiência na definição e implementação de padrões de confiabilidade, resiliência e escalabilidade em plataformas críticas.
Categorias
Sobre a Empresa
Mais vagas na Raízen →Somos uma empresa integrada de energia. Uma verdadeira potência verde. Referência global em bioenergia, somos protagonistas na transição energética e estamos redefinindo o futuro da energia. Estamos entre os maiores grupos empresariais privados do Brasil e nosso time é nosso maior diferencial: mais...[Ver Mais]
Informações Adicionais
Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"
PUBLICIDADE
Candidatar-se a esta vaga →
Você será redirecionado para o site da empresa
Vagas Relacionadas
PUBLICIDADE