Co jsou indexy v databázích, k čemu slouží a jaká je jejich vnitřní struktura?
Data Engineer
Pověz mi o své pracovní zkušenosti na posledních místech, jaké projekty, jaký stack?
Jaký je rozdíl mezi UNION a UNION ALL? Jaké podmínky musí být splněny?
Jaké skupiny SQL operátorů znáte? Čemu patří?
Co je to Catalyst optimalizér v Spark a jaké konkrétní optimalizace provádí (například predicate pushdown)?
Jak funguje Hash Join?
Co je normalizace? Na jaké formě hlavně pracujeme?
Jak ověřujete správnost dat při překladu pipeline z SAS do DBT?
Proč dochází k deadlockům a jaký mechanismus v databázích je odpovědný za konzistenci dat při paralelních dotazech?
Proč jste si vybrali právě DBT? Jaké výhody a nevýhody vidíte v tomto rámci?
V jaké fázi, jaké kontroly se provádějí a co se děje s neplatnými daty při kontrole kvality dat (Data Quality)?
Pracoval jste s incidenty kvality dat?
Jaké jsou vlastnosti a rozdíly mezi Set a List v Pythonu? Kromě výkonu, jaké další vlastnosti existují?
Pověz o zajímavém úkolu ve firmě za posledních 2,5 roku, například souvisejícím s ClickHouse.
Jak funguje Merge Join (sjednocení s tříděním)?
Jaké formáty distribuce jsou v Greenplum kromě BY column a RANDOMLY?
Uveďte posloupnost prováděných operací v SQL dotazu s SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT od první po poslední.
Raději pracujete jako expert individuálně nebo v týmu vývojářů?
Jaké druhy fyzického spojení tabulek existují (Hash Join, Merge Join, Nested Loop)?
Co bude zachyceno jako výsledek, pokud spojíte transakce s klienty podle client_id a date_start (bez BETWEEN)?