Mis on LEFT SEMI JOIN ja LEFT ANTI JOIN Spark SQL-is, kas te olete kunagi kasutanud?
Data Engineer
Mis on partitsioonimine? Mis on sharding? Mis on replikatsioon?
Mis käivitab uue töö Sparkis ja kuidas töö jaguneb etappideks ja ülesanneteks?
Kui me seame tingimuse filtri jaoks tehingu kuupäeva WHERE (pärast LEFT JOIN), kas piirab esimese tabeli (klientide) tulemust?
Mille eest vastutab Rühma rida Parquet faili struktuuris?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 VALI a.num KÄ a_num, b.num KÄ b_num FROM t1 a VASAK JOIN t2 b ON a.num = b.num;
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Mida tagastab find_mode funktsioon loendist [1, 2, 3, 3, 4, 5]? Selgita samm-sammult.
Kuidas erinevad partitsioneerimine ja sharding?
Mis vahe on Parquet salvestusvormingul ja CSV-l?
## moda ülesanne # On arvude nimekiri. Kirjutage funktsioon, mis leiab selle nimekirja moda. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Räägi, kus sa töötasid süsteemianalüütikuna ja milliseid ülesandeid täitsid?
Milliseid meetodeid (tüüpe) tead andmeajalugu salvestada? Kuidas koguneb ajalugu tabelites?
Millised füüsilised JOIN-id Sparkis eksisteerivad?
Kuidas välja tuua iga kliendi viimane täis nimi, kui teada ainult alguskuupäev (lõppkuupäev on teadmata)?
Kas tegi ise ise andmeid kvaliteedi kontrolli või tulid nõuded ärilt/klientidelt?
Milline füüsiline JOIN-mehhanism kasutatakse transaktsioonide tabeli ühendamisel kalendritabeliga ebavõrdsustingimuse (kuupäev <= kuupäev) alusel?
Mida tähendab UNBOUNDED PRECEDING akna funktsiooni piirides?
Milline töövorm on sinu jaoks mugavam — kontor, hübriid või kaugtöö? Meil on kaks kontorit, Kutuzovskaja ja Tula.
Kas oled kunagi töötanud AQE (Adaptive Query Execution) optimeerijaga Sparkis? Kas tead, kuidas see töötab?