Van egy ügyfél táblánk (azonosító, név, cím stb.), termékek (azonosító, név stb.), termékmozgás (itt van ügyfél azonosító, termék, dátum, mennyiség, összeg), meg kell találni, mely termékeket adták el január 1-jén, csak az egyedi, és meg kell mutatni a vásárló nevét és...
Data Engineer
Dolgozott adatüveg (DWH réteg) rendszerrel?
Mire számítasz fizetésként?
Mesélj néhány legfontosabb adatminőséggel kapcsolatos feladatodról.
Ha tranzakciókat összekapcsolod ügyfelekkel a client_id és a date_start szerint (BETWEEN nélkül), mit fog eredményezni az eredményben?
Mi az a CROSS JOIN? Munkáltál már vele?
Miért keresel most új munkahelyet, szeretnéd megváltoztatni a munkádat?
Milyen JOIN típusokat ismersz? (logikai)
Lehet-e párhuzamosan olvasni adatokat egy Parquet fájlból Sparkban, vagy csak egy maggal egy feladatban?
Mik az előnyei és hátrányai a sor- és oszlop-alapú adatbázisoknak? Melyik hatékonyabb csoportosítás és összegzés szempontjából?
Írja le az ablakfüggvényeket a lehető legbővebb formában: mely kulcsszavakat használják és mindegyik mire szolgál.
Ha az executoron 10 mag van, hány feladat fut párhuzamosan egy időben?
Mesélj magadról — munkatapasztalat, technológiai stack
-- Adott a numbers tábla egy oszloppal, neve num (egész számok, ismétlődhetnek). -- Írjon SQL lekérdezést, amely a számokat két oszlopra bontja: -- even – páros számok (növekvő sorrendben) -- odd – páratlan számok (növekvő sorrendben) -- A számokat soronként kell elhelyezni: az első sorban – az első páros és az első páratlan, -- a második sorban – a második páros és a második páratlan, stb. -- Ha az egyik csoportban több szám van, mint a másikban, a hiányzó helyek NULL értékűek legyenek. -- eredeti tábla -- num -- --------- -- [phone] -- lekérdezés eredménye -- even | odd -- -----|----- -- 2 | 1 -- 4 | 3 -- 6 | 5 -- 8 | 7 -- 10 | 9 -- NULL | 11 -- NULL | 11
Mesélj aadat az adatok minőségéről — volt már tapasztalatod ezzel a területtel kapcsolatban?
Mi az index? Miben különbözik a klaszterezett index a nem klaszterezett indextől?
Milyen irányban lenne érdekes fejlődni — kirakatok, fejlesztés, elemzés, esetleg AI?
Mi az a LEFT SEMI JOIN és LEFT ANTI JOIN a Spark SQL-ben, használtad már őket?
Hogyan működik a Nested Loop Join, és mi az algoritmikus összetettsége? Mekkora az összes három algoritmus összetettsége?
Mi indítja egy új Job létrehozását a Spark-ben, és hogyan oszlik a Job Stages és Tasks-ra?