Puoi spiegare cosa otterremo alla fine qui? Devi commentare ogni passaggio, come funziona.
Data Engineer
Trino in questo schema si occupa dell'elaborazione dei dati — come la pila tecnologica consente di separare l'archiviazione e i calcoli?
Data Vault è uno strumento comodo, ma ci sono trotti oggetti. Puoi spiegare la differenza tra hub, link e satellite?
Qual è la differenza tra CTE e sottoquery?
Conosci una libreria in Rust, multithreaded, molto veloce, che possa sostituire Pandas per Data Science e Big Data?
Quali tecnologie hai usato per ottenere e caricare i dati in Parquet, e quali meccanismi sono stati utilizzati?
Come suddividere una richiesta in fasi? Cosa facciamo per questo?
Come hai scritto il DAG di Airflow e i job: a mano o usando modelli?
Hai caricato dati da Spark su S3 in formato Parquet, e poi da Parquet a Greenplum — come avviene il processo di caricamento?
Con lo streaming, Iceberg funzionava, hai sentito? È un archivio di file spazzatura.
È in tempo reale, come implementarlo tra Kafka e ClickHouse Spark?
Come sono stati caricati i dati dalla tabella esterna nelle tabelle di destinazione?
Con dipendenze tra lavori, tra DAG — hai usato sensori affinché vengano eseguiti uno dopo l'altro?
Come progettavi lo schema del database? Lo facevi manualmente nel database, o conservavi gli script da qualche parte, o usavi Liquibase? Qual era il processo?
Ha senso usare una CTE se viene usata una sola volta nella query?
Hai dovuto lavorare direttamente con Spark? Qual è il suo svantaggio?
Analizzeremo JSON — chi analizzerà JSON? A quanto ne so, in ClickHouse non ci sono funzioni.
Hai lavorato con Git? Cosa conservavi in Git?
Abbiamo bisogno di un motore di pipeline — un meccanismo che consenta di creare flussi molto rapidamente fornendo contratti e parametri in ingresso. Come lo implementeresti a un livello superiore?
Hai mai lavorato con l'ottimizzazione delle query? Da dove inizia l'ottimizzazione?