Data Engineer
Quali parametri aggiuntivi di DDL/CREATE TABLE in ClickHouse conosci, a cosa influenzano e in quali casi vengono utilizzati?
Come ti sei connesso a OpenMetadata e cosa hai fatto con essa?
In quale team e sotto quale leadership ti senti più a tuo agio nel lavorare?
Spiega a livello generale come è strutturata l'architettura di Spark: quali componenti ci sono e come interagiscono durante l'esecuzione di una query SQL.
Cosa succedeva quando si attivava la restrizione sulla qualità dei dati: avviso, crash, riavvio?
## problema della moda # C'è una lista di numeri. Scrivi una funzione che trovi la moda di questa lista. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Cosa restituirà la funzione find_mode per la lista [1, 2, 3, 3, 4, 5]? Spiega passo passo.
Perché stai considerando offerte di lavoro in questo momento?
Cos'è l'Esecuzione di Query Adattativa (AQE)?
Qual è la differenza tra virtualizzazione e containerizzazione (Docker)?
Hai lavorato con parametri e hint che determinano l'uso di Broadcast Join?
Come progettavi lo schema del database? Lo facevi manualmente nel database, o conservavi gli script da qualche parte, o usavi Liquibase? Qual era il processo?
Qual meccanismo fisico di JOIN verrà utilizzato unendo la tabella delle transazioni con la tabella del calendario secondo la condizione di disuguaglianza (data <= data)?
Come funziona il Nested Loop Join e qual è la sua complessità algoritmica? Qual è la complessità di tutti e tre gli algoritmi?
Cosa hai scritto in Python oltre all'Airflow DAG?
Quali algoritmi fisici JOIN funzionano nei database?
Parlami del tuo livello di Python: cosa hai usato, quanto approfonditamente conosci la programmazione orientata agli oggetti
Come funziona Hash Join?
Come gestire lo shuffle in Spark (partizionamento, broadcast join, ecc.)?
Hai amministrato Airflow o hai lavorato solo come sviluppatore?