Compito n°2 Scrivi una query che mostri i TOP-3 dipendenti per stipendio in ogni dipartimento. Mostra il nome del dipartimento, il nome del dipendente e il suo stipendio. tabella employee: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | tabella department: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Output: department_name, num, employee_name, salary with cte as( select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id
Data Engineer
Qual è la differenza tra ACID e il teorema CAP?
Cos'è l'Esecuzione di Query Adattativa (AQE)?
Da quali fasi è composta una transazione?
Hai mai lavorato con i decoratori in Python? Cos'è e dove vengono applicati?
Risultato finale: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | con cte come( select order_id, customer_id, order_dt, lag(order_dt) over(partition by customer_id order by order_dt) as prev_order_ft, datediff(day, prev_order_ft, order_dt) as gap_days da Orders ) selezionare customer_id, max(gap_days) come gap_days da cte dove gap_days > 60 gruppo per customer_id
Qual è il pericolo dello shuffle in Spark?
In quale situazione la ricerca in un dizionario può degradarsi fino al caso peggiore?
Parla dei tipi di dati mutabili e immutabili in Python e fornisci esempi.
Hai lavorato con parametri e hint che determinano l'uso di Broadcast Join?
Spiega i calcoli pigri e immediati in Spark.
Quali sono i rischi per la qualità dei dati?
Come evitare l'avvio simultaneo di circa 700 esecuzioni DAG durante catchup/backfill in Airflow?
Parlami più dettagliatamente della rete: cos'è e perché è importante?
Come gestivi di solito gli errori e gli avvisi nei pipeline?
Domanda #1 Quante record restituirà la query con inner, left, right, full join di due tabelle unite sull’attributo id t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Come distingui le verifiche tecniche e commerciali dei dati, e chi dovrebbe stabilire i requisiti per esse?
Cosa sai sulla serializzazione e deserializzazione nel contesto di Spark/UDF?
Qual è la differenza tra repartition e coalesce in Spark?
Perché bool([""]) restituisce True?