È possibile leggere i dati in parallelo da un singolo file Parquet in Spark, o solo con un core in un task?
Data Engineer
Parlami di te — esperienza lavorativa, stack tecnologico
Parlami di alcune delle tue attività più importanti legate alla qualità dei dati.
Abbiamo una tabella clienti (id, nome, indirizzo, ecc.), prodotti (id, nome, ecc.), movimento di prodotti (qui abbiamo id cliente, prodotto, data, quantità, somma), dobbiamo trovare quali prodotti sono stati venduti il 1° gennaio, solo quelli unici, e anche mostrare il nome dell'acquirente e...
Qual è lo stipendio che ti aspetti?
Parlami della tua comprensione della qualità dei dati — hai esperienza nel lavorare in questo campo?
Cos'è un CROSS JOIN? Hai lavorato con questo?
Perché stai cercando un nuovo lavoro ora, vuoi cambiare lavoro?
Quali tipi di JOIN conosci? (logici)
Quali JOIN fisici conosci?
Quali sono i vantaggi e gli svantaggi dei database a righe e colonne? Quale è più efficiente per raggruppamento e aggregazione?
C'è una tabella T1 (10 righe) e una tabella T2 (5 righe), entrambe con un campo ID. Quante righe al massimo e al minimo possono esserci in output con un INNER JOIN e un LEFT JOIN di queste tabelle?
-- La tabella dada numbers con una colonna num (numeri interi, che possono ripetersi). -- Scrivi una query SQL che divida i numeri in due colonne: -- even – numeri pari (ordinati in modo crescente) -- odd – numeri dispari (ordinati in modo crescente) -- I numeri devono essere disposti riga per riga: nella prima riga – il primo numero pari e il primo dispari, -- nella seconda riga – il secondo numero pari e il secondo dispari, ecc. -- Se in un gruppo ci sono più numeri che nell’altro, le posizioni mancanti devono essere NULL. -- tabella originale -- num -- --------- -- [phone] -- risultato della query -- even | odd -- -----|----- -- 2 | 1 -- 4 | 3 -- 6 | 5 -- 8 | 7 -- 10 | 9 -- NULL | 11 -- NULL | 11
Cos'è LEFT SEMI JOIN e LEFT ANTI JOIN in Spark SQL, hai mai dovuto usarli?
Se sull'executor ci sono 10 core, quante task verranno eseguite in parallelo in un momento?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefono] null null 5 SELEZIONA a.num COME a_num, b.num COME b_num DA t1 a LEFT JOIN t2 b ON a.num = b.num;
Descrivi le funzioni di finestra nella forma più estesa possibile: quali parole chiave vengono utilizzate e a cosa serve ciascuna.
Cosa restituirà la funzione find_mode per la lista [1, 2, 3, 3, 4, 5]? Spiega passo passo.
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Spiega a livello generale come è strutturata l'architettura di Spark: quali componenti ci sono e come interagiscono durante l'esecuzione di una query SQL.