Data Engineer
Que tipos de JOIN físicos existem no Spark?
Com quais parâmetros do motor Distributed no ClickHouse você está familiarizado?
Está familiarizado com ReplicatedQueue? Tem experiência de trabalho com ela?
Como impedir que dados incorretos carregados na vitrine ou na tabela intermediária cheguem às pipelines superiores?
Como diferem os requisitos de potência de cálculo do armazenamento em ETL e ELT?
Quanto tempo trabalhou com Spark no total e quão profundamente se envolveu nele?
O que são operações preguiçosas no Spark e para que servem?
O que acontece no PostgreSQL após executar uma consulta SELECT * FROM [tabela]?
É possível criar e aplicar um decorador sem a sintaxe @?
Como trabalhar com partições através de coalesce e repartition?
Como determinaram que a entrada já existe e que não é necessário gravá-la novamente?
NULL mais 5 — quanto será?
É possível ler dados em paralelo de um único arquivo Parquet no Spark, ou apenas com um núcleo numa tarefa?
Com que formatos de ficheiros trabalhou?
Fale sobre si: experiência, tarefas, recursos ou conquistas de que se orgulhe.
Tem experiência com FastAPI?
Fizeste verificações estatísticas?
O que é um decorador em Python?
Como implementar a distribuição desigual dos dados na vitrine: 50% na primeira e 25% nas duas restantes?
Em que situação a busca por um dicionário pode degradar-se até ao pior caso?