Compass.UOL

Site Reliability Engineer (SRE)

🌍 Remoto📍 Remoto
PUBLICIDADE

Descrição da Vaga

A Compass UOL está em busca de um(a) Site Reliability Engineer (SRE) Sênior para garantir a confiabilidade, disponibilidade e desempenho de sistemas e aplicações em produção. O profissional irá atuar com tecnologias como AWS, Kubernetes e Databricks, projetando e implementando automações e evoluindo ambientes críticos.

Responsabilidades

  • Garantir a confiabilidade, disponibilidade e desempenho de sistemas e aplicações em produção;
  • Projetar, implementar e evoluir automações para deploy, monitoramento, escalabilidade e operação da plataforma;
  • Administrar e evoluir ambientes Kubernetes, assegurando estabilidade e alta disponibilidade;
  • Responder a incidentes críticos, conduzindo análises de causa raiz (RCA) e implementando ações preventivas;
  • Definir, acompanhar e evoluir indicadores de confiabilidade, como SLIs, SLOs e SLAs;
  • Gerenciar e otimizar pipelines de CI/CD, promovendo entregas contínuas e seguras;
  • Implementar e manter infraestrutura como código (IaC), garantindo padronização e automação dos ambientes;
  • Desenvolver e fortalecer práticas de observabilidade, monitoramento, métricas e alertas;
  • Colaborar com equipes de desenvolvimento na construção de aplicações resilientes, escaláveis e de alta performance;
  • Documentar procedimentos operacionais, planos de contingência e boas práticas de operação;
  • Atuar na melhoria contínua da plataforma, reduzindo falhas recorrentes e aumentando a confiabilidade dos serviços.
PUBLICIDADE

Requisitos

  • Experiência sólida como Site Reliability Engineer (SRE), DevOps Engineer ou Platform Engineer;
  • Vivência em administração de ambientes Kubernetes em produção;
  • Experiência com infraestrutura em cloud, preferencialmente AWS;
  • Conhecimento em automação de infraestrutura utilizando Terraform e Infrastructure as Code (IaC);
  • Experiência com pipelines CI/CD, processos de integração e entrega contínua;
  • Vivência com ferramentas de observabilidade, monitoramento e gestão de incidentes;
  • Experiência em troubleshooting de aplicações distribuídas e ambientes críticos de produção;
  • Experiência com Databricks e Apache Spark;
  • Experiência com AWS CodePipeline;
  • Conhecimento em bancos de dados SQL, Data Warehouse e modelagem de dados;
  • Experiência com Amazon EC2, Amazon S3 e AWS Lambda;
  • Conhecimento em arquitetura cloud e ambientes Microsoft Azure;
  • Conhecimento em práticas de alta disponibilidade, escalabilidade, resiliência e recuperação de incidentes;
  • Capacidade de atuar de forma analítica na identificação de causas raiz e implementação de melhorias contínuas;
  • Certificações Databricks.

 A Compass UOL é especialista em serviços de transformação digital. Projetamos e construímos plataformas nativas digitais usando tecnologias de ponta para ajudar empresas a inovar, transformar seus negócios e prosperar em seus setores.[Ver Mais]

Informações Adicionais

Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"
PUBLICIDADE
Candidatar-se a esta vaga →

Você será redirecionado para o site da empresa

PUBLICIDADE