Conheces o formato Avro?
Data Engineer
Fala sobre bases de dados relacionais em geral — o que são?
O que é ACID? O que significa cada letra? Como isso se relaciona com transações?
Quando não precisamos de armazenamento de dados?
Você mencionou processos Docker, pode explicar com mais detalhes como isso funciona aí na sua empresa?
O que é tipagem pato (duck typing)?
Tiveste alguma experiência com imagens Docker, configurando ambientes numa máquina virtual?
Quais são as limitações no uso de tabelas hash?
Como está organizado o seu QA (verificação de qualidade de dados)?
Que tipos de ligações físicas (métodos de junção) existem?
Qual é a diferença entre refatoração e otimização?
O que é um plano de consultas? Para que servem?
Tem experiência com Table Engine Join no ClickHouse?
Fale-me sobre a sua experiência com bases de dados distribuídas (Greenplum, ClickHouse)?
Imagine que o Data Vault não está disponível e há duas tabelas amplas que precisam ser unidas. Como otimizar isso no Greenplum? E se fosse no ClickHouse?
O que atualmente não gostas no teu trabalho?
Tem experiência com motores como Trino ou com formatos de tabela (Iceberg, Parquet) no Spark?
Será que há alguma coisa mais que se possa pensar em vez de um CTE normal, considerando que a filtragem ainda ocorre na memória em toda a tabela?
Em que ambiente o Spark foi executado?
Para que é que você precisava do Data Vault, em geral?