O que são índices em bancos de dados, para que servem e qual é a sua estrutura interna?
Data Engineer
Fala sobre a sua experiência nos últimos empregos, quais os projetos, qual stack?
Qual é a diferença entre UNION e UNION ALL? Quais condições devem ser cumpridas?
Que grupos de operadores SQL conhece? A que pertencem?
Como funciona o Hash Join?
O que é o otimizador Catalyst no Spark e quais exemplos específicos de otimizações ele realiza (por exemplo, predicate pushdown)?
Por que ocorrem deadlocks e qual mecanismo nos bancos de dados é responsável pela consistência dos dados em consultas paralelas?
Como verifica a precisão dos dados ao traduzir um pipeline de SAS para DBT?
Já trabalhou com incidentes de qualidade de dados?
O que é normalização? Em que forma trabalhamos principalmente?
Por que escolheram especificamente o DBT? Quais são as vantagens e desvantagens deste framework?
Verificações de qualidade de dados — em que fase, que verificações, o que acontece com os dados inválidos?
Fale sobre uma tarefa interessante na empresa nos últimos 2,5 anos, por exemplo, relacionada com o ClickHouse.
Quais são as características e diferenças entre Set e List em Python? Além do desempenho, que outras características existem?
Como funciona o Merge Join (junção com ordenação)?
Gostas mais de trabalhar individualmente como especialista ou em uma equipe de desenvolvedores?
Quais são os formatos de distribuição no Greenplum além de BY column e RANDOMLY?
Liste a sequência de operações de uma consulta SQL com SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT, da primeira até a última.
Temos uma tabela de clientes (id, nome, endereço, etc.), produtos (id, nome, etc.), movimento de produtos (aqui temos id do cliente, produto, data, quantidade, soma), precisamos encontrar quais produtos foram vendidos a 1 de janeiro, apenas os únicos, e também mostrar o nome do comprador e...
Por que estás procurando um novo emprego agora, queres mudar de trabalho?