Descrição da Vaga
Buscamos uma Pessoa Engenheira de Dados Júnior para atuar dedicada em um banco digital de grande porte, em plena expansão, contribuindo na construção e na evolução de pipelines de dados que sustentam produtos, análises e modelos de negócio do banco. Você fará parte de um time de plataforma de dados em ambiente AWS, participando do ciclo completo dos dados — da ingestão e transformação em PySpark à disponibilização em camadas de Data Lake / Lakehouse — com acompanhamento de pessoas engenheiras sêniores, exposição a arquitetura moderna de dados em escala e uso de IA aplicada ao dia a dia de engenharia. É uma posição de crescimento, com espaço para aprender, assumir responsabilidades gradualmente e evoluir tecnicamente.
Responsabilidades
- Desenvolver e manter pipelines de dados em Python / PySpark, seguindo padrões definidos pelo time.
- Escrever e ajustar consultas SQL para extração, transformação e validação de dados.
- Apoiar a ingestão de dados de diferentes fontes (bancos relacionais, APIs, eventos) para o Data Lake em AWS (S3, Glue, Athena, EMR).
- Participar da construção e manutenção de DAGs de orquestração no Airflow, sob orientação técnica.
- Aplicar boas práticas de modelagem em arquitetura medalhão (bronze, prata, ouro) e formatos colunares (Parquet / Delta).
- Implementar validações e checagens de qualidade de dados, documentando regras e resultados.
- Utilizar Git e a esteira de CI/CD para versionamento, revisão (code review) e deploy dos pipelines.
- Apoiar o monitoramento dos pipelines em produção, identificando falhas e ajudando na correção.
- Participar de cerimônias ágeis, refinamento de demandas e estimativas junto ao time.
- Utilizar ferramentas de IA aplicadas ao desenvolvimento (GitHub Copilot, Claude Code ou similares) para acelerar codificação, testes e documentação, com senso crítico sobre o resultado gerado.
Requisitos
- ✓Experiência prática em Python aplicado a dados, ainda que em projetos de menor porte, estágio ou acadêmicos
- ✓Conhecimento de SQL: joins, agregações, CTEs e funções de janela
- ✓Noções de Apache Spark / PySpark (DataFrames, transformações e ações)
- ✓Familiaridade com conceitos de Data Lake, Data Warehouse e Lakehouse
- ✓Familiaridade com Git e fluxo de branches / pull requests
- ✓Noções de serviços de dados em nuvem, preferencialmente AWS (S3, Glue, Athena ou EMR)
- ✓Vivência ou interesse em metodologias ágeis (Scrum/Kanban)
- ✓Formação em andamento ou concluída em Ciência da Computação, Engenharia, Sistemas de Informação, Estatística, Análise e Desenvolvimento de Sistemas ou áreas correlatas
- •Experiência ou estágio no setor financeiro, bancário ou fintech
- •Contato com Airflow ou outra ferramenta de orquestração
- •Noções de Kafka ou outras plataformas de streaming de dados
- •Contato com Docker, Kubernetes ou Terraform
- •Conhecimento de Trino / Presto ou Databricks
- •Noções de qualidade de dados, testes de pipeline e observabilidade
- •Certificações em AWS ou Databricks (Cloud Practitioner, Data Engineer Associate ou similares)
- •Uso de ferramentas de IA no fluxo de desenvolvimento
- •Inglês para leitura de documentação técnica
Benefícios
- ✓Vale Alimentação e/ou Vale Refeição
- ✓Convênio Sesi e Sesc, oferecendo acesso a serviços de saúde, bem-estar e lazer
- ✓Parceria com Instituições de Ensino, com descontos exclusivos em cursos e programas educacionais
- ✓Auxílio para Certificações
- ✓Possibilidade de crescimento na empresa e de participação em projetos estratégicos
Categorias
Sobre a Empresa
Mais vagas na Extractta →A Extractta nasceu com o propósito de transformar tecnologia em resultados reais para empresas de diversos segmentos. Ao longo da nossa trajetória, nos consolidamos como uma consultoria de inovação e tecnologia que une estratégia, pessoas e soluções digitais para apoiar organizações em seus desafios...[Ver Mais]
Informações Adicionais
Você será redirecionado para o site da empresa