Descrição da Vaga
A Prime Control busca um(a) Especialista DevOps para atuar na definição, implementação e evolução da estratégia de observabilidade, utilizando AppDynamics como plataforma central de APM, complementada por Prometheus/Grafana, ELK/Splunk e OpenTelemetry. O profissional será responsável por estabelecer e governar SLIs, SLOs, SLAs e error budgets de aplicações críticas, além de projetar e manter dashboards operacionais e executivos.
Responsabilidades
- Definir, implementar e evoluir a estratégia de observabilidade (métricas, logs e tracing distribuído), tendo o AppDynamics como plataforma central de APM, complementada por Prometheus/Grafana, ELK/Splunk e OpenTelemetry.
- Estabelecer e governar SLIs, SLOs, SLAs e error budgets das aplicações críticas, negociando metas com as áreas de negócio e garantindo o cumprimento.
- Projetar e manter dashboards operacionais e executivos por persona (negócio, NOC e engenharia), traduzindo telemetria em indicadores acionáveis (MTTR, MTTD, disponibilidade, aderência a SLO, saúde de jornadas de negócio).
- Implementar detecção de anomalias e indicadores inteligentes (AIOps) — baselines dinâmicos, alertas por desvio, correlação de eventos e redução de ruído.
- Monitorar e assegurar a saúde da camada de mensageria e integração (RabbitMQ e Kafka): backlog de filas, idade e taxa de consumo de mensagens, DLQ, clustering e resiliência.
- Comandar incidentes críticos (major incidents): coordenar a resposta, comunicação com stakeholders, escalonamento e restabelecimento do serviço.
- Conduzir post-mortems / RCA sem culpa, identificando causa raiz e implementando ações preventivas.
- Reduzir toil por meio de automação operacional, IaC e ferramentas internas.
- Apoiar capacity planning, testes de resiliência (chaos engineering / game days) e planos de continuidade (BCP/DR — RTO/RPO).
- Atuar em conformidade com requisitos de segurança, privacidade e regulação (LGPD, PCI-DSS, diretrizes BACEN de resiliência operacional e políticas globais do grupo).
Requisitos
- ✓Experiência em operação/engenharia de TI.
- ✓Experiência em SRE ou observabilidade de aplicações de missão crítica.
- ✓Domínio de AppDynamics (instrumentação, business transactions, health rules, baselines, dashboards e alertas) em ambiente de produção.
- ✓Experiência sólida com mensageria — RabbitMQ (exchanges, filas, DLQ, clustering) e desejável Kafka.
- ✓Definição prática de SLI/SLO/SLA e error budgets.
- ✓Experiência real em gestão de incidentes e regime de on-call.
- ✓Conhecimento de containers e orquestração (Docker, Kubernetes/OpenShift).
- ✓Scripting/automação com Python, Go ou Bash.
- ✓Vivência com CI/CD e Infraestrutura como Código (Terraform, Ansible).
- ✓Experiência em ambiente de nuvem (AWS, Azure ou GCP).
- ✓Inglês intermediário/avançado (interação com times globais do cliente).
Categorias
Sobre a Empresa
Mais vagas na Prime Control →A Prime Control nasceu com o propósito de conectar pessoas que constroem histórias de sucesso através da tecnologia. O digital cresceu tanto que é difícil imaginar nossas vidas sem Internet, apps, ecommerce, mídias sociais, bancos digitais e mais uma série de coisas incríveis, não é mesmo? Então, me...[Ver Mais]
Informações Adicionais
Você será redirecionado para o site da empresa