Cosa sono gli indici nei database, a cosa servono e qual è la loro struttura interna?
Data Engineer
Parlami della tua esperienza lavorativa negli ultimi posti, quali progetti, quale stack?
Qual è la differenza tra UNION e UNION ALL? Quali condizioni devono essere soddisfatte?
Quali gruppi di operatori SQL conosci? A cosa appartengono?
Cos'è l'ottimizzatore Catalyst in Spark e quali esempi specifici di ottimizzazioni esegue (ad esempio, predicate pushdown)?
Come funziona Hash Join?
Cos'è la normalizzazione? Su quale forma lavoriamo principalmente?
Come verifici la correttezza dei dati durante la traduzione di un pipeline da SAS a DBT?
Perché si verificano i deadlock e quale meccanismo nei database garantisce la coerenza dei dati durante le query parallele?
Perché avete scelto specificamente DBT? Quali sono i vantaggi e gli svantaggi di questo framework?
In quale fase, quali controlli vengono effettuati e cosa succede con i dati non validi durante i controlli di qualità dei dati (Data Quality)?
Hai lavorato con incidenti di qualità dei dati?
Quali sono le caratteristiche e le differenze tra Set e List in Python? Oltre alle prestazioni, quali altre caratteristiche ci sono?
Parla di un compito interessante in azienda negli ultimi 2,5 anni, ad esempio legato a ClickHouse.
Come funziona Merge Join (unione con ordinamento)?
Quali sono i formati di distribuzione in Greenplum oltre a BY column e RANDOMLY?
Elenca la sequenza di esecuzione delle operazioni in una query SQL con SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT, dalla prima all'ultima.
Preferisci lavorare come esperto individualmente o in un team di sviluppatori?
Quali tipi di connessione fisica delle tabelle esistono (Hash Join, Merge Join, Nested Loop)?
Cosa verrà catturato come risultato se si uniscono le transazioni con i clienti per client_id e date_start (senza BETWEEN)?