Descrição da Vaga
A Mazzatech busca um Engenheiro de Infraestrutura Sênior com sólida experiência em AWS e Kubernetes para atuar na administração e evolução de ambientes de desenvolvimento, homologação e produção. O profissional será responsável por manter e otimizar recursos de computação, rede, armazenamento, banco de dados, cache, filas e segurança, além de liderar tecnicamente a implementação e evolução do Kubernetes.
Responsabilidades
- Administrar ambientes de desenvolvimento, homologação e produção na AWS.
- Manter e evoluir recursos de computação, rede, armazenamento, banco de dados, cache, filas e segurança.
- Avaliar arquiteturas existentes e propor melhorias de disponibilidade, escalabilidade, segurança e custo.
- Identificar recursos ociosos, superdimensionados, mal configurados ou sem monitoramento.
- Planejar mudanças de infraestrutura com análise de impacto e estratégia de rollback.
- Garantir a padronização dos ambientes.
- Apoiar a criação e evolução de arquiteturas para novas aplicações e microsserviços.
- Documentar topologias, dependências, configurações e procedimentos operacionais.
- Atuar na sustentação de ambientes críticos e na resolução de incidentes.
- Liderar tecnicamente a implementação e evolução do Kubernetes.
- Participar do desenho, implantação e operação de clusters Amazon EKS.
- Planejar a migração gradual de aplicações executadas em ECS e Fargate para Kubernetes.
- Definir padrões para deployments, services, ingress, secrets, config maps, jobs e cron jobs.
- Criar e revisar manifestos Kubernetes e charts Helm.
- Definir padrões de namespaces, permissões, isolamento e organização dos clusters.
- Configurar requests, limits, autoscaling, readiness probes e liveness probes.
- Definir estratégias de rolling update, rollback, blue-green e canary deployment.
- Investigar pods com falhas, reinícios, problemas de memória, CPU, rede, DNS ou dependências.
- Gerenciar imagens Docker e repositórios no Amazon ECR.
- Revisar Dockerfiles quanto a segurança, tamanho, desempenho e boas práticas.
- Apoiar desenvolvedores na adequação de aplicações para execução em containers.
- Administrar VPCs, subnets públicas e privadas, tabelas de rotas, gateways e NAT Gateways.
- Criar e revisar Security Groups e Network ACLs.
- Configurar conectividade segura entre aplicações, bancos, caches e serviços internos.
- Implementar restrições e liberações de acesso por IP.
- Administrar acessos por VPN e redes privadas.
- Apoiar integrações que exijam IP fixo de saída ou inclusão em listas de IP permitidos.
- Diagnosticar problemas de rede, DNS, rotas, portas, latência e resolução de nomes.
- Administrar Route 53, certificados digitais e AWS Certificate Manager.
- Configurar e revisar Application Load Balancers e Network Load Balancers.
- Garantir que bancos de dados, caches e serviços internos não sejam expostos desnecessariamente à internet.
- Avaliar conectividade entre regiões, contas e redes externas.
- Aplicar o princípio do menor privilégio em usuários, grupos, roles e policies do IAM.
- Revisar acessos humanos, acessos de aplicações e permissões concedidas a pipelines.
- Estruturar e revisar políticas de acesso aos ambientes de produção.
- Gerenciar segredos por meio do AWS Secrets Manager.
- Administrar chaves e criptografia utilizando AWS KMS.
- Garantir criptografia de dados em trânsito e em repouso.
- Configurar e revisar regras no AWS WAF.
- Analisar trilhas de auditoria no AWS CloudTrail.
- Identificar recursos públicos, portas abertas e configurações inseguras.
- Apoiar a rotação de credenciais, chaves, tokens e certificados.
- Participar da investigação de incidentes de segurança.
- Implementar controles para evitar alterações manuais não rastreadas.
- Apoiar requisitos relacionados à LGPD, governança e proteção de dados.
- Manter sistemas operacionais, imagens e componentes de infraestrutura atualizados.
- Criar e manter infraestrutura utilizando Terraform ou CloudFormation.
- Priorizar o Terraform como ferramenta de padronização e evolução do ambiente.
- Estruturar módulos reutilizáveis.
- Organizar estados, ambientes e variáveis de forma segura.
- Implementar validações, revisões e planos antes da aplicação de mudanças.
- Evitar criação manual de recursos sem rastreabilidade.
- Manter a infraestrutura versionada em Git.
- Criar padrões para desenvolvimento, homologação e produção.
- Documentar procedimentos de execução, rollback e recuperação do estado.
- Apoiar a implementação de políticas e controles automatizados sobre a infraestrutura.
- Configurar e evoluir o Amazon CloudWatch.
- Criar dashboards técnicos e operacionais.
- Configurar métricas, logs, alarms e filters.
- Centralizar logs de aplicações, containers, load balancers e serviços AWS.
- Criar alertas para indisponibilidade, erros, latência e saturação.
- Monitorar CPU, memória, storage, rede, conexões, filas e health checks.
- Definir retenção adequada de logs, equilibrando necessidade operacional e custo.
- Criar alertas que sejam acionáveis e possuam responsáveis definidos.
- Apoiar a definição de indicadores de disponibilidade e desempenho.
- Investigar aumentos inesperados no volume de logs ou nos custos de observabilidade.
- Desenvolver runbooks para resposta a alertas e incidentes recorrentes.
- Avaliar a adoção de Prometheus, Grafana e OpenTelemetry quando necessário.
- Analisar continuamente os custos da infraestrutura.
- Identificar anomalias de consumo e aumentos inesperados.
- Avaliar custos de EC2, ECS, EKS, RDS, ElastiCache, Load Balancers, VPC, CloudWatch e Data Transfer.
- Realizar rightsizing de instâncias, bancos e containers.
- Analisar a adoção de Savings Plans e Reserved Instances.
- Revisar custos de NAT Gateway, transferência de dados e tráfego entre regiões.
- Revisar retenção de logs, snapshots, volumes, imagens e arquivos.
- Criar rotinas de desligamento de ambientes não produtivos quando aplicável.
- Identificar recursos sem utilização ou sem proprietário definido.
- Criar dashboards, alertas e relatórios de custos.
- Avaliar o impacto financeiro antes da implantação de novas arquiteturas.
- Recomendar ações de redução de custos sem comprometer disponibilidade, segurança ou desempenho.
- Apoiar a criação de uma cultura de FinOps.
- Monitorar ambientes Amazon RDS.
- Analisar CPU, memória, storage, IOPS, conexões e latência.
- Apoiar o dimensionamento de instâncias MySQL e PostgreSQL.
- Analisar gargalos de infraestrutura que afetem o banco de dados.
- Apoiar configurações de backup, snapshots, read replicas e failover.
- Participar de testes de restore.
- Monitorar e administrar Amazon ElastiCache e Redis.
- Investigar consumo de memória, conexões, eviction e indisponibilidade do cache.
- Apoiar a análise de queries lentas e excesso de conexões em conjunto com desenvolvimento e DBA.
- Planejar manutenções e mudanças com menor impacto para as aplicações.
- Participar da definição de RTO e RPO para bancos e caches.
- Criar e manter pipelines utilizando AWS CodePipeline e CodeBuild.
- Automatizar build, criação de imagens, publicação no ECR e deploy.
- Integrar pipelines com ECS, EKS e infraestrutura como código.
- Criar processos seguros de promoção entre desenvolvimento, homologação e produção.
- Implementar validações antes de alterações de infraestrutura.
- Criar scripts em Python ou Bash para automação de atividades operacionais.
- Utilizar Python e boto3 para inventário, monitoramento, segurança, custos e rotinas administrativas.
- Reduzir tarefas manuais e repetitivas.
- Apoiar a implementação de estratégias de rollback.
- Garantir rastreabilidade das mudanças executadas.
- Definir e revisar políticas de backup.
- Garantir que recursos críticos estejam incluídos nas rotinas de backup.
- Realizar testes periódicos de restauração.
- Documentar procedimentos de recuperação.
- Apoiar a definição de RTO e RPO por sistema.
- Avaliar a necessidade de redundância entre zonas e regiões.
- Planejar a recuperação de aplicações, bancos, arquivos, configurações e segredos.
- Criar runbooks de disaster recovery.
- Participar de simulações de falha e indisponibilidade.
- Identificar pontos únicos de falha e propor correções.
- Atuar diretamente na investigação de incidentes de infraestrutura.
- Identificar rapidamente se a origem está em rede, container, cluster, banco, cache, pipeline ou serviço AWS.
- Participar de salas de crise quando necessário.
- Comunicar impacto, diagnóstico e ações de maneira objetiva.
- Executar correções emergenciais com controle de risco.
- Registrar as mudanças realizadas durante o incidente.
- Conduzir ou participar de análises de causa raiz.
- Criar ações preventivas para evitar recorrência.
- Apoiar equipes de desenvolvimento durante incidentes relacionados às aplicações.
- Criar automações e documentação para problemas recorrentes.
Requisitos
- ✓Experiência sólida como Engenheiro de Infraestrutura, Cloud Engineer, Platform Engineer ou função equivalente.
- ✓Experiência prática e recente com AWS em ambientes críticos de produção.
- ✓Conhecimento avançado de Amazon VPC.
- ✓Conhecimento avançado de Security Groups, rotas, subnets e conectividade.
- ✓Experiência sólida com IAM, roles, policies e princípio do menor privilégio.
- ✓Experiência prática com Amazon ECS e AWS Fargate.
- ✓Experiência com AWS CodePipeline e CodeBuild.
- ✓Experiência com AWS Secrets Manager.
- ✓Experiência avançada com Amazon CloudWatch.
- ✓Experiência com configuração de alarms, metrics, logs e dashboards.
- ✓Experiência prática com Docker.
- ✓Experiência prática com Kubernetes em produção.
- ✓Capacidade de implementar e administrar clusters Kubernetes.
- ✓Experiência com Amazon EKS ou Kubernetes gerenciado equivalente.
- ✓Experiência com Terraform ou CloudFormation.
- ✓Experiência com criação e manutenção de pipelines de CI/CD.
- ✓Domínio de Linux e troubleshooting.
- ✓Conhecimento de redes, DNS, certificados, VPN e controle de acesso por IP.
- ✓Conhecimento de Load Balancers e health checks.
- ✓Experiência com investigação de incidentes de produção.
- ✓Conhecimento de backup, restore, alta disponibilidade e disaster recovery.
- ✓Conhecimento de segurança de infraestrutura em nuvem.
- ✓Capacidade de analisar e otimizar custos AWS.
- ✓Conhecimento operacional de bancos de dados relacionais e Redis.
- ✓Experiência com Git e processos de revisão de mudanças.
- ✓Capacidade de criar documentação técnica e runbooks.
- ✓Disponibilidade para atuação presencial quatro vezes por semana em São Paulo.
- ✓Experiência prática com arquitetura de clusters Kubernetes.
- ✓Experiência prática com Deployments.
- ✓Experiência prática com StatefulSets.
- ✓Experiência prática com DaemonSets.
- ✓Experiência prática com Services.
- ✓Experiência prática com Ingress.
- ✓Experiência prática com ConfigMaps.
- ✓Experiência prática com Secrets.
- ✓Experiência prática com Jobs e CronJobs.
- ✓Experiência prática com Requests e limits.
- ✓Experiência prática com Readiness e liveness probes.
- ✓Experiência prática com Horizontal Pod Autoscaler.
- ✓Experiência prática com Persistent Volumes.
- ✓Experiência prática com Helm.
- ✓Experiência prática com Namespaces.
- ✓Experiência prática com RBAC.
- ✓Experiência prática com Network Policies.
- ✓Experiência prática com Troubleshooting de pods.
- ✓Experiência prática com Diagnóstico de DNS e rede.
- ✓Experiência prática com Análise de consumo de CPU e memória.
- ✓Experiência prática com Estratégias de rollout e rollback.
- ✓Experiência prática com Gestão de logs e métricas.
- ✓Experiência prática com Atualização e manutenção de clusters.
Categorias
Sobre a Empresa
Mais vagas na mazzatech →Mazzatech is a global IT professional services company partnering with you to provide solutions to your project’s requirements and challenges in today’s highly competitive technology environment. We supply integrated IT services ecosystems, designed with your business success in mind, for toda...[Ver Mais]
Informações Adicionais
Você será redirecionado para o site da empresa