Come funziona l'ottimizzatore di query in Oracle, cosa guarda e a quale classe appartiene?
Data Engineer
Qual è lo scopo di suddividere i dati in blocchi in HDFS?
Come hai lavorato con Impala?
In cosa si differenzia HDFS dai normali sistemi di file distribuiti?
Come funziona MapReduce, in particolare la fase Reduce?
Cos'è YARN e a cosa serve?
Come hai lavorato con CI/CD?
Come hai caricato i dati da S3 in Greenplum?
Cos'è lo shuffle in Spark e perché è importante minimizzarlo?
Come visualizzare il piano di esecuzione di una query in Oracle? In cosa si differenziano EXPLAIN PLAN e EXPLAIN ANALYZE?
Parli dell'uso delle procedure PL/SQL nel suo lavoro.
Cos'è una join broadcast in Spark?
Hai esperienza nell'ottimizzazione dei compiti Spark? Puoi fare un esempio concreto?
Hai mai dovuto scrivere pacchetti in Oracle?
Hai lavorato con caricamenti incrementali e completi? Come hai gestito i duplicati?
Qual è il vantaggio della memorizzazione a colonna rispetto a quella a riga?
Come viene letto un file da HDFS, ad esempio Parquet — interamente o a blocchi?
Qual è la differenza tra RANK e DENSE_RANK?
Puoi spiegare il partizionamento in Oracle: a cosa serve e quali tipi ci sono?
Cos'è Hive e come si differenzia dai tradizionali database relazionali?