Fale sobre a tarefa de configuração de replicação que você resolveu.
Data Engineer
Em que casos a normalização é aplicada e em quais a desnormalização?
Como evitar/remover o viés dos dados no Spark?
Qual é o algoritmo de diagnóstico e o que fazer se a consulta ainda estiver lenta após adicionar vários índices?
O que é normalização e modelo ER, para que servem?
Fale sobre os conceitos básicos do Kafka (grupo de consumidores, partições, tópicos).
Quais são as causas típicas de uma consulta em um SGBD que funciona lentamente?
Que problemas não óbvios podem surgir ao carregar tabelas grandes (além de desempenho)?
Proponha uma solução para o carregamento incremental regular de uma grande tabela com uma frequência de atualização flexível (alterável) do Postgres para o Data Lake.
Como é que a ordenação dentro da função de janela está relacionada com a ordenação final ORDER BY na consulta?
Como gerir os recursos de uma aplicação Spark para não gastar memória ao alterar o volume de dados de entrada?
Como trabalhar com partições através de coalesce e repartition?
Que imagens Docker teve de construir e para quê?
Existem outros mecanismos de gestão do shuffle além de coalesce/repartition?
Quais parâmetros do Spark JDBC foram utilizados para paralelizar a leitura?