Kstack

Site Reliability Engineer (SRE) – GCP Platform

📍 São Paulo, SP🏢 Híbrido
PUBLICIDADE

Descrição da Vaga

A Kstack está em busca de um(a) Site Reliability Engineer (SRE) com foco em Google Cloud Platform (GCP) para atuar na melhoria da confiabilidade, escalabilidade e resiliência de plataformas e infraestruturas digitais. Este(a) profissional irá operar na intersecção entre engenharia de software e engenharia de sistemas, construindo automação para eliminar tarefas manuais e prevenindo proativamente incidentes que possam impactar os serviços. O(a) SRE irá projetar, construir e suportar sistemas distribuídos, tolerantes a falhas e de larga escala no Google Cloud Platform (GCP), garantindo alta disponibilidade e performance das plataformas críticas de negócio, ao mesmo tempo em que suporta um ritmo acelerado de implantação de funcionalidades.

Responsabilidades

  • Projetar, construir e manter ferramentas de automação e infraestrutura como código (IaC) para eliminar tarefas operacionais manuais e otimizar fluxos de trabalho de implantação.
  • Colaborar com equipes de produto e desenvolvimento para definir, monitorar e aplicar Indicadores de Nível de Serviço (SLIs) e Objetivos de Nível de Serviço (SLOs) para serviços críticos.
  • Projetar e implementar sistemas robustos de monitoramento, alerta e log para garantir visibilidade profunda da saúde da aplicação e da infraestrutura.
  • Participar de um rodízio de plantão para fornecer suporte operacional. Liderar e participar de post-mortems sem culpa para identificar causas raiz e implementar medidas preventivas.
  • Otimizar a infraestrutura de nuvem GCP para performance, custo e escalabilidade. Gerenciar balanceamento de carga, roteamento de tráfego e configurações de autoescalonamento.
  • Suportar e aprimorar pipelines de integração contínua e entrega contínua (CI/CD) para garantir lançamentos de software seguros, previsíveis e frequentes.
  • Planejar, implementar e testar estratégias de recuperação de desastres, failover e backup para garantir a continuidade dos negócios.
  • Revisar a arquitetura e o código da aplicação para garantir a aderência aos padrões de prontidão para produção, melhores práticas de segurança e diretrizes de escalabilidade.
PUBLICIDADE

Requisitos

  • Bacharelado em ciência da computação, Tecnologia da Informação ou área relacionada, ou combinação equivalente de educação e experiência.
  • 5 a 8 anos de experiência em SRE, DevOps ou Engenharia de Sistemas em Nuvem.
  • Experiência na implantação e gerenciamento de cargas de trabalho no Google Cloud Platform (GCP).
  • Familiaridade com serviços GCP como GKE (Google Kubernetes Engine), Compute Engine, Cloud Run, Cloud Functions e Big Query.
  • Conhecimento sólido de Docker e gerenciamento, implantação e solução de problemas de Kubernetes.
  • Experiência prática com ferramentas de Infrastructure as Code (IaC) como Terraform.
  • Conhecimento aprofundado de administração Linux/Unix, protocolos de rede (TCP/IP, DNS, HTTP/S) e internos do sistema.
  • Proficiência em pelo menos uma linguagem de script ou programação para automação (e.g., Python, Go ou Bash).
  • Experiência com ferramentas de monitoramento e log, especificamente GCP Cloud Monitoring/Logging (Stackdriver), ou equivalentes de código aberto como Prometheus, Grafana e ELK stack.
  • Experiência com pipelines de implantação modernos e ferramentas de controle de versão (e.g., GitHub Actions, GitLab CI, Jenkins ou Google Cloud Build).
  • Excelentes habilidades analíticas e de solução de problemas, com capacidade comprovada para depurar sistemas distribuídos complexos sob pressão.
  • Compreensão da cultura SRE, focando em correções sistêmicas em vez de erro humano durante retrospectivas de incidentes.
  • Adesão demonstrada a práticas modernas de Gerenciamento de Mudanças e fluxos de trabalho GitOps.
  • Habilidade para interagir e colaborar eficazmente com desenvolvedores de software, gerentes de produto, equipes de segurança e stakeholders de negócios.
  • Certificação Google Cloud Certified Professional Cloud DevOps Engineer, Professional Site Reliability Engineer ou Certified Kubernetes Administrator (CKA).

Somos uma consultoria especializada em conectar os melhores profissionais de tecnologia as melhores vagas do mercado – tanto no Brasil quanto no exterior.Atuamos com posições estratégicas e táticas na carreira Tech, como QAs, Desenvolvedores, Scrum Masters, Product Owners, Analistas de Negócios, Ger...[Ver Mais]

Informações Adicionais

Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"
PUBLICIDADE
Candidatar-se a esta vaga →

Você será redirecionado para o site da empresa

PUBLICIDADE