🏢

Pessoa Engenheira de Dados Sênior

🌍 Remoto📍 Remoto
PUBLICIDADE

Descrição da Vaga

A Caju, uma empresa brasileira de tecnologia, está em busca de uma Pessoa Engenheira de Dados Sênior para integrar seu time. O profissional será responsável por projetar, construir e manter pipelines de dados robustos, garantindo a integração, ingestão e orquestração de dados de múltiplas fontes, além de otimizar a performance e o custo das operações em ambientes AWS e Databricks.

Responsabilidades

  • Projetar e manter pipelines de integração heterogênea utilizando Apache Airflow, Dagster, Airbyte, AWS DMS, DBT, Kubernetes, APIs REST, SFTP e conectores diversos para ingestão contínua.
  • Aplicar técnicas avançadas de particionamento, indexação (Z-Ordering/Liquid Clustering), otimização de layout de arquivos e estratégias de escrita/leitura no Amazon S3, Databricks e dbt.
  • Projetar e implementar ingestão de dados em tempo real por tópicos e eventos (ex: Apache Kafka, AWS Kinesis, Event Hubs).
  • Implementar ferramentas, agentes e pipelines de GenAI/LLMs para automatizar tarefas operacionais da engenharia (ex: geração automática de documentação, pipelines, data quality checks, tradução/refatoração de SQL, análise de causa raiz de falhas, PRs).
  • Projetar, construir e manter pipelines robustos, aplicando modelagem dimensional e arquitetura Medallion para entregar dados limpos, agregados e otimizados.
  • Garantir compliance (LGPD/GDPR), mascaramento de dados sensíveis, lineage, controle de acesso granular e monitoramento proativo de data freshness e data quality.
  • Realizar levantamento de necessidades junto às áreas de negócio, documentar arquiteturas, definir data contracts e assegurar a governança e manutenibilidade dos pipelines.
PUBLICIDADE

Requisitos

  • Experiência sólida em engenharia de dados, atuando em ambientes de produção de grande volume e alta criticidade.
  • Domínio prático de estratégias de particionamento, otimização de layouts de dados (Small File Problem, compactação, Z-Ordering) e otimização de consultas para prevenir leituras excessivas no Amazon S3 e garantir baixo tempo de resposta no Databricks e dbt.
  • Experiência prática na integração e orquestração de dados utilizando Airflow, Dagster, Airbyte, AWS DMS, dbt, Kubernetes, APIs REST, SFTP e conectores customizados.
  • Vivência prática na arquitetura de ingestão baseada em eventos/tópicos (Kafka, Kinesis, Pulsar, RabbitMQ) para substituir a dependência de bancos relacionais.
  • Domínio avançado de Python, PySpark e SQL otimizado para processamento massivo e distribuído.
  • Experiência profunda no ecossistema Databricks (Delta Lake, Auto Loader, Structured Streaming, Jobs/Workflows, Medallion Architecture).
  • Vivência em serviços AWS voltados a dados (S3, IAM, Redshift, DynamoDB, Data Catalog, AWS DMS).
  • Conhecimento prático ou forte interesse em utilizar ferramentas/LLMs para automação de tarefas de desenvolvimento e engenharia de dados.
  • Vivência com testes automatizados, controle de versão (Git/GitHub), revisão de PRs e pipelines de CI/CD.
  • Domínio em modelagem de dados (Dimensional, Star/Snowflake) e diretrizes de segurança e privacidade (LGPD/GDPR).
  • Experiência com pipelines para suporte a IA (ingestão, chunking e embeddings para Vector Search, Feature Stores, governança via Unity Catalog).
  • Experiência com Unity Catalog, Terraform e Databricks Asset Bundles (DAB).
  • Implementação de contratos de dados na origem e uso de frameworks de qualidade/observabilidade (Great Expectations, Soda, dbt tests, Datadog).
  • Gestão proativa e alertas de anomalias de custos em nuvem/Databricks por tabela e pipeline, alinhada à detecção estatística de data drift.
  • Vivência em idempotência, conciliação de saldos e reprocessamento financeiro.
  • Experiência prévia em ambientes fintech, meios de pagamento ou saúde, lidando com compliance e auditorias de dados.

Benefícios

  • Cartão Caju (Refeição, Alimentação, Mobilidade, Saúde, Home Office, Cultura e Educação)
  • Plano de Saúde sem coparticipação (Unimed, Sulamerica ou Alice)
  • Zenklub (consultas online com terapeutas e coaches)
  • Wellhub
  • Parceria Rosetta Stone (aprendizado de idiomas)
  • Dia de recarregar - day off
  • Conexa Saúde (consulta médica online)
  • Auxílio Creche
  • Parceria com Alura
  • Oferecimento de equipamento de trabalho

Sobre a Empresa

Mais vagas na Caju →

Caju é uma empresa de tecnologia, fruto do empreendedorismo brasileiro, criada para transformar a relação entre empresas e colaboradores, com soluções inovadoras e flexíveis.  Desenvolvemos uma plataforma para que as empresas possam fazer a gestão de diversas soluções no mesmo lu...[Ver Mais]

Informações Adicionais

Selecionamos as principais informações da posição. Para conferir o descritivo completo, clique em "acessar"
PUBLICIDADE
Candidatar-se a esta vaga →

Você será redirecionado para o site da empresa

PUBLICIDADE