Sign up free to see how well your resume matches this role.
About this role
.
Reconstruir os pipelines do DW legado em Databricks (PySpark / Spark SQL), a partir das especificações geradas pela engenharia reversa;
Implementar as camadas bronze, silver e gold seguindo o template medalhão, os padrões de ingestão (CDC/batch) e o padrão de reconstrução definidos pelo projeto;
Executar as waves de reconstrução por domínio, em coexistência com o DW legado até o cutover;
Implementar regras de negócio e transformações com testes automatizados nos pipelines;
Realizar a reconciliação e a validação de paridade dos dados entre o DW legado e o Lakehouse;
Otimizar performance e custo dos pipelines (particionamento, OPTIMIZE/Z-ORDER, dimensionamento de jobs);
Contribuir com a documentação técnica das regras migradas e apoiar a priorização das waves.
Experiência sólida com Engenharia de Dados;
PySpark e Python avançados: desenvolvimento de pipelines batch em escala, com testes e boas práticas de engenharia;
SQL avançado e modelagem de dados: transformações complexas, tuning de performance e modelagem relacional/dimensional em contexto de DW;
Databricks e Delta Lake: jobs, workflows e arquitetura medalhão (bronze, silver, gold) em produção; Delta Live Tables / Lakeflow e Asset Bundles;
Migração / reconstrução de pipelines ETL: tradução de regras de negócio de ferramentas legadas para Spark (sem lift-and-shift), com ingestão CDC/batch de bancos relacionais;