V jakém směru by bylo zajímavé se rozvíjet: výlohy, vývoj, analýza, možná AI?
Data Engineer
Pokud nastavíme podmínku filtrování podle data transakce v WHERE (po LEFT JOIN), omezí to výsledek v první tabulce (zákazníci)?
Jak funguje Nested Loop Join a jaká je jeho algoritmická složitost? Jaká je složitost všech tří algoritmů?
Za co odpovídá Skupina řádků ve struktuře souboru Parquet?
Čím se liší parciování od shardingu?
Vysvětli obecně, jak je navržena architektura Spark: jaké komponenty existují a jak spolu komunikují při vykonávání SQL dotazu.
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 VYBER a.num AKO a_num, b.num AKO b_num Z t1 a LEVA PŘIPOJENÍ t2 b ON a.num = b.num;
Pověz mi, kde jsi pracoval jako systémový analytik a jaké úkoly jsi plnil?
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
## úloha módu # Seznam čísel. Napište funkci, která najde mód tohoto seznamu. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
V čem se liší formát ukládání Parquet od CSV?
Co je spouštěčem pro vytvoření nového Jobu v Spark a jak je Job rozdělen na Stages a Tasks?
Prováděli jste kontroly kvality dat sami, nebo přišly požadavky od podnikání/zákazníků?
Jaké metody (typy) ukládání historie dat znáte? Jak se historie v tabulkách akumuluje?
Co znamená UNBOUNDED PRECEDING v hranicích okna okna funkce?
Jaký fyzický mechanismus JOIN bude použit při spojení tabulky transakcí s tabulkou kalendáře podle podmínky nerovnosti (datum <= datum)?
Jak zobrazit poslední celé jméno každého klienta, pokud je známa pouze počáteční datum (konec není znám)?
Jak správně určit pole distribuce v Greenplum? Co se děje při Motion?
Proč hledáte nové zaměstnání a čím byste se chtěli v budoucnu zabývat?
Pracoval jste někdy s optimalizátorem AQE (Adaptivní vykonávání dotazů) v Spark? Víte, jak funguje?