Jaké druhy fyzického spojení tabulek existují (Hash Join, Merge Join, Nested Loop)?
Data Engineer
Proč te teď hledáš nové zaměstnání, chceš změnit práci?
Co je to CROSS JOIN? Pracoval jsi s tím?
Lze číst data paralelně z jednoho souboru Parquet ve Spark, nebo pouze jedním jádrem v jedné úloze?
Jaké typy JOIN znáš? (logické)
Co bude zachyceno jako výsledek, pokud spojíte transakce s klienty podle client_id a date_start (bez BETWEEN)?
Pověz mi o několika svých nejdůležitějších úkolech souvisejících s kvalitou dat.
Jaké jsou výhody a nevýhody řádkových a sloupcových databází? Které jsou efektivnější pro seskupování a agregaci?
Pověz mi o sobě — pracovní zkušenosti, technologický stack
Pracoval jste s datovými vitrínami (vrstva DWH)?
Pověz mi o svém chápání kvality dat — máš zkušenosti s tímto oborem?
-- Daná tabulka numbers s jednou sloupcem num (celá čísla, mohou se opakovat). -- Napište SQL dotaz, který rozdělí čísla do dvou sloupců: -- even – sudá čísla (seřazená vzestupně) -- odd – lichá čísla (seřazená vzestupně) -- Čísla by měla být řádek po řádku: v prvním řádku – první sudé a první liché, -- ve druhém řádku – druhé sudé a druhé liché, atd. -- Pokud je v jedné skupině více čísel než v jiné, na chybějících místech by měly být NULL. -- původní tabulka -- num -- --------- -- [phone] -- výsledek dotazu -- even | odd -- -----|----- -- 2 | 1 -- 4 | 3 -- 6 | 5 -- 8 | 7 -- 10 | 9 -- NULL | 11 -- NULL | 11
Jaké fyzické JOINy znáš?
Existuje tabulka T1 (10 řádků) a tabulka T2 (5 řádků), obě s polem ID. Kolik řádků může být maximálně a minimálně na výstupu při INNER JOIN a LEFT JOIN těchto tabulek?
Pokud má na executoru 10 jader, kolik úloh bude současně prováděno v jednom okamžiku?
Popište okénkové funkce v co nejrozšířenější podobě: jaká klíčová slova se používají a za co každé z nich odpovídá.
Co je LEFT SEMI JOIN a LEFT ANTI JOIN v Spark SQL, musel jste je někdy použít?
Co vrátí funkce find_mode pro seznam [1, 2, 3, 3, 4, 5]? Vysvětli krok za krokem.
Co je to partice? Co je to sharding? Co je to replikace?
Pokud nastavíme podmínku filtrování podle data transakce v WHERE (po LEFT JOIN), omezí to výsledek v první tabulce (zákazníci)?