Apskritai paaiškinkite, kaip sukonstruota Spark architektūra: kokie komponentai yra ir kaip jie sąveikauja vykdant SQL užklausą.
Data Engineer
Kas yra partizavimas? Kas yra sharding? Kas yra replikacija?
Kas sukelia naujo darbo Spark'e sukūrimą ir kaip darbas yra padalintas į Stages ir Tasks?
Jei nustatome filtravimo sąlygą pagal sandorio datą WHERE (po LEFT JOIN), ar tai apribos rezultatą pirmojoje lentelėje (klientai)?
Kuo atsakinga Eilutės grupė Parquet failo struktūroje?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefono] null null 5 PASIRINKTI a.num KAIP a_num, b.num KAIP b_num Iš t1 a Kairysis JOIN t2 b ON a.num = b.num;
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Ką grąžins funkcija find_mode sąrašui [1, 2, 3, 3, 4, 5]? Paaiškink žingsnis po žingsnio.
Kuo skiriasi partizavimas nuo sharding'o?
Kuo skiriasi Parquet saugojimo formatas nuo CSV?
## mados užduotis # Yra skaičių sąrašas. Parašykite funkciją, kuri suranda šio sąrašo modą. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Papaskinkite, kur dirbote kaip sistemų analitikas ir kokius uždavinius atlikote?
Kokius metodus (tipus) žinote duomenų istorijos saugojimui? Kaip kaupiasi istorija lentelėse?
Kokie fiziniai JOIN tipai egzistuoja Spark?
Kaip išgauti kiekvieno kliento paskutinį pilną vardą, jei žinoma tik pradžios data (pabaigos data nežinoma)?
Ar pats atlikote duomenų kokybės patikrinimus, ar reikalavimai kilo iš verslo/paslaugų teikėjų?
Koks fizinis JOIN mechanizmas bus naudojamas jungiant sandorių lentelę su kalendoriaus lentele pagal nelygybės sąlygą (data <= data)?
Ką reiškia UNBOUNDED PRECEDING lango funkcijos ribose?
Koks darbo formatas jums patogiausias — biuras, hibridas ar nuotolinis darbas? Turime du biurus, Kutuzovsky ir Tula.
Ar kada nors dirbote su AQE (Adaptive Query Execution) optimizatoriumi Spark? Ar žinote, kaip jis veikia?