Engenheiro de Dados Sênior
First Help Financial · São Paulo, SP · Remoto · GeekHunter
Sobre a vaga
Requisitos
- 5+ anos de experiência na carreira
- Inglês avançado
- Airflow
- Data Quality
- Data Modeling
- Delta Lake
- dbt
- Entity Resolution
- PySpark
- SQL
- Python
- Databricks
Conhecimentos Desejáveis
- Terraform
- MLOps
- Data Observability
- Unity Catalog
- Data Products
- Data Reconciliation
- Delta Live Tables
- RAG
- Data Governance
- MCP
- Data Lineage
- GitHub Actions
- Postgres
- AWS
Tarefas e Responsabilidades
Sobre a vagaBuscamos um Engenheiro de Dados Sênior para liderar tecnicamente iniciativas de dados em escala nacional. Esta posição tem como foco central a resolução de entidades, governança de dados mestres e reconciliação de fontes de terceiros, garantindo a qualidade e observabilidade dos dados em toda a cadeia produtiva.
Você será referência técnica para o time, conduzindo revisões de código com foco em correção, custo e manutenibilidade, além de aplicar engenharia assistida por IA com guardrails e rastreabilidade.
Principais responsabilidades- Definir regras de fonte única da verdade, lógica de sobrevivência, identificadores estáveis e overrides manuais para dados de licenças, escrituras, registros fiscais e dados comerciais.
- Reconciliar fontes de terceiros conflitantes em escala nacional e implementar observabilidade para detectar desvios na lógica.
- Atuar como steward de modelos de dados, aterrissando novas fontes e evoluindo modelos quando deixarem de atender às necessidades.
- Garantir qualidade de dados ponta a ponta: testes, monitoramento, alertas, lineage e análise de causa raiz de incidentes.
- Conduzir análises que orientem o roadmap, priorizando aquisições de fontes e datasets com base no impacto comercial.
- Colocar modelos de ciência de dados em produção, definindo contratos de dados e monitoramento de drift.
- Ser referência técnica do time em revisões de código e trade-offs de arquitetura.
- Aplicar engenharia assistida por IA com agentes, mantendo guardrails e rastreabilidade.
- SQL e Python sólidos aplicados em todo o ciclo de vida dos dados, da ingestão ao serving.
- Experiência hands-on com Databricks em produção: notebooks, jobs, workflows, Delta Lake e PySpark.
- Profundidade em modelagem de dados: dimensional, slowly changing dimensions, definição de grain e arquitetura em camadas como medallion.
- Experiência com resolução de entidades e reconciliação de dados.
- Conhecimento em qualidade e observabilidade de dados: testes, monitoramento, alertas e lineage.
- Familiaridade com frameworks de transformação e orquestração como dbt, Airflow e Databricks Workflows, com version control e CI/CD.
- Experiência com data products alimentando aplicações em produção, além de traduzir perguntas de negócio ambíguas em métricas acionáveis.
- Arquitetura de data products orientada a domínios em lakehouse.
- Arquiteturas de IA aplicadas a dados: pipelines para RAG, MCP para acesso padronizado por agentes e qualidade em sistemas agentic não determinísticos.
- Ecosistema avançado Databricks: Unity Catalog e Delta Live Tables.
- Governança de dados: controle de acesso, catalogação e lineage.
- MLOps avançado: model serving, monitoramento de drift e workflows de retreinamento.
Python, SQL, PySpark, Databricks, Delta Lake, dbt, AWS, Terraform, Postgres, GitHub Actions e agentes de IA no dia a dia do desenvolvimento.
Requisitos principais
Candidatura
Publicado há 2 semanas