Data Engineer
Qual recurso é mais consumido na junção de loop aninhado?
O que é versionamento semântico? Quando aumentar major, minor, patch?
Escreve um DAG simples para Apache Airflow
Conhece os cubos OLAP? Quando trabalhamos com dados multidimensionais, semelhantes a uma tabela dinâmica no Excel, mas para uma interação mais rápida com grandes volumes de dados.
O que é estatística no contexto de SGBDs e otimização de consultas?
Você mencionou processos Docker, pode explicar com mais detalhes como isso funciona aí na sua empresa?
CREATE TABLE core.localUserMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = ReplicatedReplacingMergeTree() ORDER BY (UserId); CREATE TABLE core.userMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate Datetime ) ENGINE = Distributed('cluster_4x2', 'core', 'localUserMetadata', cityHash64(LastLoginDate));
Usaram um bucket S3 ou vários? Com que princípio?
O que é shuffle no Spark e por que é importante minimizá-lo?
O armazenamento foi construído de acordo com o esquema Data Vault — você também o desenvolveu, manteve? Adicionou hubs, links manualmente?
Qual é a complexidade algorítmica da pesquisa num dicionário no pior caso?
Conta-me, o que gostas de fazer no teu tempo livre além de programar? Quais são os teus hobbies?
O que significa UNBOUNDED PRECEDING nas janelas de funções de janela?
Fala mais sobre a rede: o que é e por que é importante?
Como funciona o JOIN no ClickHouse?
Por quais campos você distribuiu os dados no Greenplum?
Tem experiência em otimização de tarefas Spark? Pode dar um exemplo concreto?
Se juntar transações com clientes por client_id e date_start (sem BETWEEN), o que será capturado no resultado?
Quando construías pipelines no Airflow, como resolvias o problema de dados lixo (dados inválidos/não válidos)?
Fala-me sobre a tua compreensão da qualidade dos dados — já tiveste experiência a trabalhar nesta área?