Ce JOIN-uri fizice cunoști?
Data Engineer
Explică pe scurt cum este structurată arhitectura Spark: ce componente există și cum interacționează în timpul executării unei interogări SQL.
Ce este partiționarea? Ce este sharding-ul? Ce este replicarea?
Dacă stabilim o condiție de filtrare după data tranzacției în WHERE (după LEFT JOIN), va limita aceasta rezultatul din prima tabelă (clienți)?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 SELECT a.num CAUTĂ a_num, b.num CAUTĂ b_num DIN t1 a JOIN stânga t2 b PE a.num = b.num;
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Cu ce se ocupă Grupul de Rânduri în structura fișierului Parquet?
## problemă despre moda # Există o listă de numere. Scrieți o funcție care găsește moda acestei liste. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Ce va returna funcția find_mode pentru lista [1, 2, 3, 3, 4, 5]? Explică pas cu pas.
Care este diferența dintre partiționare și sharding?
Care este diferența dintre formatul de stocare Parquet și CSV?
Spune-mi unde ai lucrat ca analist de sistem și ce sarcini ai îndeplinit?
Ce metode (tipuri) de stocare a istoricului datelor cunoști? Cum se acumulează istoricul în tabele?
Ce format de lucru îți este mai convenabil — birou, hibrid sau de la distanță? Avem două birouri, pe Kutuzovsky și Tula.
Ce tipuri de JOIN-uri fizice există în Spark?
Cum se afișează ultimul nume complet pentru fiecare client, dacă se cunoaște doar data de început (data de sfârșit nu este cunoscută)?
Ce înseamnă UNBOUNDED PRECEDING în limitele funcției de fereastră?
Verificările de calitate a datelor le făceai tu însuți sau cerințele veneau din partea afacerii/clienților?
Ce mecanism fizic de JOIN va fi utilizat la unirea tabelului de tranzacții cu tabelul de calendar după condiția de inegalitate (data <= data)?
Cum se determină corect câmpul de distribuție în Greenplum? Ce se întâmplă în timpul Motion?