Data Engineer
Quale framework hai usato per scrivere i pipeline? Come hai usato Airflow?
Con le tue parole, cos'è un FULL JOIN?
Tecnicamente, un database in un DBMS è semplicemente un file, da cui derivano restrizioni come NULL/NON NULL? A cosa servono queste astrazioni logiche?
# cosa viene visualizzato s = 'abracadabra' print(s[5][0][0][0]) print(s[::-2]) s = [1, 2, 3] print(s * 2)
Hai mai riscontrato l'errore ClickHouse `Too many parts` durante un inserimento? Come l'hai risolto?
È possibile utilizzare la distribuzione casuale in Greenplum e quando è appropriato?
Perché stai cercando un nuovo lavoro?
Cosa succede fisicamente durante un INSERT, UPDATE e DELETE in Greenplum; perché dopo un DELETE lo spazio su disco non viene liberato e in cosa si differenzia DELETE da TRUNCATE?
Come impedire che dati non corretti caricati nella vetrina o nella tabella intermedia raggiungano le pipeline superiori?
Perché i dati possono andare persi? Fornisci alcune ragioni.
Come sono collegati l'ordinamento all'interno della funzione finestra e l'ordinamento finale ORDER BY nella query?
A cosa servono le "cartelle"/prefissi in S3 oltre alla comodità?
Con quali librerie Python hai lavorato?
Cos'è la partizionamento e la distribuzione (sharding)?
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
Racconta un esempio in cui hai usato l'intelligenza artificiale per automatizzare processi routinari.
Cosa fa il parametro depends_on_past in Airflow?
Qual è la differenza tra ACID e il teorema CAP?
Come lavoravano con 1C: prelevavano i dati direttamente dal database, tramite un bus o in altro modo?
Cosa succede in PostgreSQL dopo aver eseguito la query SELECT * FROM [tabella]?