Data Engineer
Come risolvere il problema quando il processo di lettura può vedere uno stato intermedio (incoerente) della tabella durante un ETL a più fasi (delete+insert) in Iceberg?
Lo storage è stato costruito secondo lo schema Data Vault — anche tu lo hai sviluppato, mantenuto? Hai aggiunto manualmente hub, link?
Hai effettuato tu stesso i controlli sulla qualità dei dati o le richieste provenivano dal business/dai clienti?
Per favore, ci dica perché è interessato a questa posizione.
In quali casi una Vista Materializzata in ClickHouse può saltare dati o, al contrario, duplicarli?
Cos'è la normalizzazione e la denormalizzazione, quando sono necessarie?
Fornisci un esempio di compito tipico di scrittura di DAG in Airflow.
Cosa è successo e come recuperare il lavoro?
Cos'è ACID? Cosa significa ogni lettera? Come si riferisce alle transazioni?
Valuta la soluzione finale in termini di tempo e memoria.
Quanto sono realistici i piani dell'azienda per costruire un sistema di raccolta, normalizzazione e analisi dei dati?
Qual è la differenza tra EXPLAIN ANALYZE e un EXPLAIN normale? Perché non è consigliabile eseguirlo su query DELETE/UPDATE?
Spiega i calcoli pigri e immediati in Spark.
C'è stata una query analitica lenta in Hive. Come capire cosa è successo e come ripararla?
Puoi spiegare cosa otterremo alla fine qui? Devi commentare ogni passaggio, come funziona.
C'è una tabella T1 (10 righe) e una tabella T2 (5 righe), entrambe con un campo ID. Quante righe al massimo e al minimo possono esserci in output con un INNER JOIN e un LEFT JOIN di queste tabelle?
Cosa verificare se i log non si aprono (errore 403)?
In quale fase, quali controlli vengono effettuati e cosa succede con i dati non validi durante i controlli di qualità dei dati (Data Quality)?
Data Vault è uno strumento comodo, ma ci sono trotti oggetti. Puoi spiegare la differenza tra hub, link e satellite?
Di cosa sono generalmente composti i log delle attività di Airflow?