Cosa sacrifica il database durante il caricamento rapido dei dati (COPY in Postgres, BULK INSERT)?
Data Engineer
Conosci il formato Avro?
Hai esperienza con le immagini Docker, configurando ambienti su una macchina virtuale?
Hai menzionato i processi Docker, puoi spiegare più nel dettaglio come è organizzato tutto questo nella tua azienda?
Cos'è il tipaggio paperino (duck typing)?
Quando non abbiamo bisogno di archiviazione dei dati?
Parlami delle banche dati relazionali in generale — cos'è?
Come è organizzato il vostro QA (controllo qualità dei dati)?
Quali sono i limiti nell'uso delle tabelle hash?
Puoi parlarmi della tua esperienza con i database distribuiti (Greenplum, ClickHouse)?
Qual è la differenza tra refactoring e ottimizzazione?
Si può pensare a qualcos'altro invece di un CTE normale, considerando che il filtraggio avviene comunque in memoria su tutta la tabella?
Hai esperienza con Table Engine Join in ClickHouse?
Supponi che Data Vault non sia disponibile e ci siano due tabelle ampie da unire. Come ottimizzeresti questo in Greenplum? E se fosse in ClickHouse?
Cos'è un piano di query? A cosa servono?
Quali sono i tipi di connessioni fisiche (metodi di join)?
Cosa non ti piace attualmente del tuo lavoro?
In quale ambiente è stato avviato Spark?
Qual è la differenza tra == e is in Python?
Cos'è la tipizzazione dinamica?