Data Engineer
Oltre all'API, quali altri metodi e protocolli hai utilizzato per lavorare con le fonti di dati?
Parlami della tua comprensione della qualità dei dati — hai esperienza nel lavorare in questo campo?
Quali agenti e modelli vengono utilizzati all'interno della tua soluzione di IA aziendale? Scrive codice per te?
A cosa servono cache e persist in Spark?
Come avete avviato i DAG: tramite cron, dataset, trigger o dipendenze?
importa clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Quali parametri di Spark JDBC sono stati utilizzati per parallelizzare la lettura?
Cos'è un CROSS JOIN e qual è il risultato della sua applicazione?
In quale direzione sarebbe interessante svilupparsi: vetrine, sviluppo, analisi, forse AI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefono] null null 5 SELEZIONA a.num COME a_num, b.num COME b_num DA t1 a LEFT JOIN t2 b ON a.num = b.num;
Quali problemi non evidenti possono verificarsi durante il caricamento di grandi tabelle (oltre alle prestazioni)?
La funzione di finestra SUM() OVER (PARTITION BY user_id) — in un caso aggiungiamo ORDER BY data di acquisto, nell'altro no. Qual è la differenza?
A cosa serviva in generale Data Vault?
Quale tipo di archiviazione ha Parquet: riga o colonna?
Parlami del compito di configurazione della replica che hai risolto.
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Parlami dei processi CI/CD, delle modifiche nel database, del versioning e delle migrazioni dello schema (evoluzione dello schema).
Cosa ti attrae del settore travel? Forse ti piace viaggiare tu stesso, o il travel-tech ti ha interessato in qualche modo?
Puoi parlarmi della tua esperienza con i database distribuiti (Greenplum, ClickHouse)?
Proponi una soluzione per il caricamento incrementale regolare di una grande tabella con una frequenza di aggiornamento flessibile (mutabile) da Postgres a Data Lake.