Data Engineer
O que é LEFT SEMI JOIN e LEFT ANTI JOIN no Spark SQL, já teve que usá-los?
Como impedir que dados incorretos carregados na vitrine ou na tabela intermediária cheguem às pipelines superiores?
Como funciona o Join de Loop Aninhado e qual é a sua complexidade algorítmica? Qual é a complexidade de todos os três algoritmos?
O que mais escreveste em Python além do DAG do Airflow?
Como dividir a consulta em etapas? O que fazemos para isso?
Qual é a diferença entre repartition e coalesce no Spark?
Como funciona o Hash Join?
Como detectar desequilíbrios de dados (data skew) no Spark?
Para que é que você precisava do Data Vault, em geral?
Quão bem conhece Linux/Docker?
Já teve que interagir diretamente com Data Scientists, recolhendo os seus requisitos?
O que acontecia quando a restrição de qualidade dos dados era acionada: alerta, queda, reinício?
O que a função find_mode retornará para a lista [1, 2, 3, 3, 4, 5]? Explique passo a passo.
Escreveu testes unitários? Tem essa experiência?
Por que está a considerar ofertas de emprego neste momento?
Já trabalhou com parâmetros e dicas que determinam o uso de Broadcast Join?
Temos um ORDER BY por quantidade de pedidos, e há dois pedidos com 5, mais dois pedidos com 3. Como se comportarão RANK() e DENSE_RANK() ?
Tem experiência em escrever documentação?
Existem funções e capacidades no Greenplum que não estão no MySQL comum e outros dialetos?
O que sabes sobre spill no Spark?