Data Engineer
Come si differenziano i requisiti di potenza di calcolo dello storage tra ETL e ELT?
Mostrare il numero di ordini e "prodotti della categoria necessaria nell'ordine" per il 2021 nelle categorie "Abbigliamento" e per il 2022 nella categoria "Calzature" (vista finale: 2 righe. Campi: anno, numero di prodotti, numero di ordini) with cte as( select year(o.order_date) as year_orders, g.cat_1, count(distinct o.order_id) as count_orders, sum(g.quantity) as count_quan from Orders o join Goods g on o.order_id = g.order_id where (g.cat_1 = 'Abbigliamento' and Year(o.order_date) = 2021) or (g.cat_1 = 'Calzature' and Year(o.order_date) = 2022) group by year_orders, g.cat_1 ) select year_orders, count_quan, count_orders from cte per il 2025, i primi 3 in ogni categoria per quantità di vendita modello with cte as( select cat_1, price, quantity, model, rank() over(partition by cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) per il 2025, i primi 3 in ogni categoria per somma di vendite modello with cte as( select g.cat_1, g.model, (price * quantity), rank() over(partition by g.cat_1) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte as( select g.cat_1, g.model, sum(price * quantity) as sum_, rank() over(partition by g.cat_1 order by sum() desc) as rk from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ) with cte1 as( select g.cat_1, g.model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 ), cte2 as(select g.cat_1, g.model, sum_total, rank() over(partition by g.cat_1 order sum_total desc) as rk from cte1 ) select g.cat_1, g.model, sum_total from cte2 where rk <=3 conoscere il nome della categoria, il modello e il totale delle vendite (top 3) with cte1 as( select g.cat_1 as cat_name, g.model as model, sum(price * quantity) as sum_total, from Orders o join Goods g on o.order_id = g.order_id where Year(o.order_date) = 2025 group by Year(o.order_date), g.model ), cte2 as(select cat_name, model, sum_total, rank() over(partition by cat_name order sum_total desc) as rk from cte1 ) select cat_name, model, sum_total from cte2 where rk <=3
Qual è l'algoritmo di diagnosi e cosa fare se la query è ancora lenta dopo aver aggiunto più indici?
Come organizzare il caricamento dei dati in ClickHouse in una grande tabella PostgreSQL, in cui arrivano costantemente nuovi record con una chiave primaria monotonicamente crescente?
Come è stato possibile ottimizzare le query su Data Vault, se di solito aumenta il numero di join?
Hai usato XCom in Airflow?
Hai scritto processi di ingestion per OpenMetadata che scansionano le fonti?
Con quali strumenti di visualizzazione hai lavorato e quanto strettamente hai collaborato con Power BI?
Cosa sai sulla serializzazione e deserializzazione nel contesto di Spark/UDF?
Compito n°2 Scrivi una query che mostri i TOP-3 dipendenti per stipendio in ogni dipartimento. Mostra il nome del dipartimento, il nome del dipendente e il suo stipendio. tabella employee: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | tabella department: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Output: department_name, num, employee_name, salary with cte as( select d.name as department_name, e.name as employee_name, e.salary, dense_rank from employee e join department d on e.id = d.id
Cosa succede se si crea un DAG con start_date = 1 gennaio 2024?
Come funziona l'hash join per tabelle con 1.000 e 1.000.000 di righe?
Si può pensare a qualcos'altro invece di un CTE normale, considerando che il filtraggio avviene comunque in memoria su tutta la tabella?
Quali comandi Linux principali usi nel terminale?
Cos'è il registro delle transazioni (WAL) in un DBMS e a cosa serve?
È stato utilizzato il metodo di confronto degli hash delle registrazioni per calcolare la differenza tra la sorgente e la tabella di destinazione?
Perché stai cercando un nuovo lavoro e cosa vorresti fare in futuro?
Perché stai cercando un nuovo lavoro ora, vuoi cambiare lavoro?
Quali metodi di trasferimento dati tra i task di Airflow conosci?
LeetCode #? — In PostgreSQL c'è una tabella [tabella] con una sola colonna id e valori 1, 1, 2. Scrivi una query DELETE che elimini fisicamente un duplicato.