Kas ir triggers jauna darba Spark, un kā darbs tiek sadalīts pa Stages un Tasks?
Data Engineer
Kopumā paskaidrojiet, kā ir uzbūvēta Spark arhitektūra: kādi komponenti ir un kā tie sadarbojas, izpildot SQL vaicājumu.
Kas ir partizēšana? Kas ir sharding? Kas ir replikācija?
Par ko atbild Rindu grupa Parquet faila struktūrā?
Ja mēs uzstādām filtrēšanas nosacījumu pēc darījuma datuma WHERE (pēc LEFT JOIN), vai tas ierobežos rezultātu pirmajā tabulā (klientiem)?
## modes uzdevums # Ir skaitļu saraksts. Uzrakstiet funkciju, kas atrod šī saraksta modā. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefons] null null 5 IZVĒLĒTIES a.num KĀ a_num, b.num KĀ b_num NO t1 a KREISĒJĀ JOIN t2 b ON a.num = b.num;
Ko atgriezīs funkcija find_mode sarakstā [1, 2, 3, 3, 4, 5]? Izskaidro soli pa solim.
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Pastāsti, kur esi strādājis kā sistēmu analītiķis un kādus uzdevumus veici?
Kāda ir atšķirība starp Parquet glabāšanas formātu un CSV?
Kā atšķiras partīcijām no sharding?
Vai jūs pats veicāt datu kvalitātes pārbaudes, vai prasības nāca no biznesa/pasūtītājiem?
Kādus metodes (tipus) pazīstat datu vēstures glabāšanai? Kā vēsture uzkrājas tabulās?
Kura darba forma jums ir ērtāka — birojs, hibrīds vai attālināts darbs? Mums ir divi biroji, Kutuzovskaja un Tula.
Vai jūs kādreiz esat strādājis ar AQE (Adaptive Query Execution) optimizatoru Spark? Vai zināt, kā tas darbojas?
Kā iegūt katra klienta pēdējo pilno vārdu, ja zināma tikai sākuma datums (beigu datums nav zināms)?
Kādi fiziskie JOIN tipi pastāv Spark?
Ko nozīmē UNBOUNDED PRECEDING loga funkcijas robežās?
Kāds fiziskais JOIN mehānisms tiks izmantots, savienojot darījumu tabulu ar kalendāra tabulu pēc nevienādības nosacījuma (datums <= datums)?