Data Engineer
Pověz mi o své pracovní zkušenosti na posledních místech, jaké projekty, jaký stack?
Pověz mi o architektuře úložiště: jak bylo rozděleno na vrstvy, jaké jsou vlastnosti každé vrstvy?
Z jakých hlavních bloků se skládá zpráva trasování (span)?
Jak funguje optimalizátor dotazů v Oracle, na co se dívá a do jaké třídy patří?
Jak parsovat velké XML soubory v ZIP a nahrát je do ClickHouse pomocí Pythonu?
Jaký je rozdíl mezi UNION a UNION ALL? Jaké podmínky musí být splněny?
Co je to DAG v Airflow, z čeho se skládá a jak Airflow spouští DAG?
Od jakých vlastností lze říct, že je potřeba datové úložiště?
Jaký typ spojení je třeba použít, aby se do výběru dostali i ti uživatelé, kteří nemají žádné objednávky? Tabulky: users(id, name) a orders(id, user_id, created_at). CROSS JOIN RIGHT JOIN INNER JOIN FULL JOIN LEFT JOIN
Jak přenést data z materializovaného pohledu v Greenplum do ClickHouse?
Jaký typ čtení se používá v ClickHouse?
Jak funguje ClickHouse a v čem se liší od PostgreSQL?
Vysvětlete, jak technicky funguje Git LFS a jaké výhody přináší ve srovnání se standardním Gitem při práci s velkými soubory.
Co je normalizace? Na jaké formě hlavně pracujeme?
Jaké typy indexů jsou v PostgreSQL?
Porovnejte přístupy Data Vault v MChS a X5. Jaké přínosy přinesly nové objekty (bridge, pit tabulky)?
Jaký je rozdíl mezi EXPLAIN a EXPLAIN ANALYZE?
Popište metody optimalizace SQL dotazů, které jste použili. Jak jste zkrátili dobu běhu z 12-15 sekund?
Jak vyřešit úlohu v lineárním čase O(n) pomocí slovníku? Co je třeba uložit do slovníku, aby bylo možné později sestavit seřazený řetězec? Jak zpracovat znaky, které nejsou v pořadí?
Porovnejte dvě řešení problému hledání jednotek podle spotřeby paměti: 1) cyklus s proměnnými, 2) split('0') + seznamové porozumění + max()