Radšej pracujete ako expert individuálne alebo v tíme vývojárov?
Data Engineer
Pracovali ste s dátovými vitrínami (vrstva DWH)?
Na aký plat si myslíš?
Ak spojíte transakcie s klientmi podľa client_id a date_start (bez BETWEEN), čo bude zachytené vo výsledku?
Prečo teraz hľadáš nové zamestnanie, chceš zmeniť prácu?
Porozprávaj mi o niektorých svojich najdôležitejších úlohách súvisiacich s kvalitou údajov.
Je možné čítať dáta paralelne z jedného súboru Parquet v Spark, alebo iba s jedným jadrom v úlohe?
Čo je to CROSS JOIN? Pracoval si s tým?
Aké typy JOIN poznáte? (logické)
Popíšte okienkové funkcie v čo najrozšírenejšej forme: aké kľúčové slová sa používajú a za čo je každé z nich zodpovedné.
Aké sú výhody a nevýhody databázových systémov založených na riadkoch a stĺpcoch? Ktoré je efektívnejšie pre zoskupovanie a agregáciu?
V ktorom smere by bolo zaujímavé sa rozvíjať — vitríny, vývoj, analýza, možno AI?
Povedz mi o sebe — pracovné skúsenosti, technologický stack
Čo je to index? Čo je rozdiel medzi klastrovaným a neklausterizovaným indexom?
Ak má executor 10 jadier, koľko úloh bude vykonávaných súčasne v jednom momente?
-- Dátová tabuľka numbers s jednou stĺpcom num (celé čísla, môžu sa opakovať). -- Napíšte SQL dotaz, ktorý rozdelí čísla do dvoch stĺpcov: -- even – párne čísla (zoradené vzostupne) -- odd – nepárne čísla (zoradené vzostupne) -- Čísla by mali byť zoradené riadok po riadku: v prvom riadku – prvé párne a prvé nepárne, -- v druhom riadku – druhé párne a druhé nepárne, atď. -- Ak je v jednej skupine viac čísel ako v druhej, na chýbajúce miesta by mali byť NULL. -- pôvodná tabuľka -- num -- --------- -- [phone] -- výsledok dotazu -- even | odd -- -----|----- -- 2 | 1 -- 4 | 3 -- 6 | 5 -- 8 | 7 -- 10 | 9 -- NULL | 11 -- NULL | 11
Povedaj mi o svojom porozumení kvality dát — máš skúsenosti s týmto smerom?
Za čo je zodpovedná Skupina riadkov v štruktúre súboru Parquet?
Čo je LEFT SEMI JOIN a LEFT ANTI JOIN v Spark SQL, museli ste ich niekedy použiť?
Aké fyzické JOIN-y poznáš?