Data Engineer
Jak načíst data z Kafka do ClickHouse pomocí streamingu pro reporty v reálném čase?
Jaké fyzické JOINy znáš?
Co je statistika v kontextu systémů správy databází a optimalizace dotazů?
Jaké SQL dotazy píšeš: jednoduché kontroly nebo složité skripty pro vitríny?
Co je to RDD v Apache Spark a čím se liší od jiných abstrakcí Spark?
Byla vytvořena speciální sekvence s názvem even_sequence, která generuje pouze sudá čísla. Co je třeba vložit na místo [...], aby v případě, že hodnota even_column nebyla při vkládání uvedena, byla použita hodnota z even_sequence? create table some_table( even_column [...] ); integer computed as nextval('even_sequence') integer generated always as identity (start with 2 increment by 2) integer default nextval('even_sequence') integer unique default nextval('even_sequence') integer generated by even_sequence’
Jaké typy JOIN znáš? Vysvětli 2-3 hlavní.
Uveďte posloupnost prováděných operací v SQL dotazu s SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT od první po poslední.
Jak postupovat při skew (šikmosti) na user_id při JOIN tabulek transakcí a uživatelů? Jak vybrat optimální klíč rozdělení?
Řekni mi víc o síti: co to je a proč je to důležité?
Jak doporučuje Git Flow formálně zaznamenat novou verzi aplikace? - Vytvořením nové issue větve - Vytvořením hotfix větve od masteru - Vytvořením samostatné release větve od develop - Přímým commitem do větve master - Sloučením větve master přímo do develop
V jakém týmu a pod jakým vedením se cítíte nejpohodlněji při práci?
Vysvětli obecně, jak je navržena architektura Spark: jaké komponenty existují a jak spolu komunikují při vykonávání SQL dotazu.
Co bude zachyceno jako výsledek, pokud spojíte transakce s klienty podle client_id a date_start (bez BETWEEN)?
Jak zobrazit poslední celé jméno každého klienta, pokud je známa pouze počáteční datum (konec není znám)?
Co je to semantické verzování? Kdy zvyšovat major, minor, patch?
Zlepšují indexy vždy výkon, nebo mohou způsobit degradaci?
Na jakých polích došlo ke sloučení dat a jak se v přehledu zbavovali duplicit?
Jak se liší požadavky na výpočetní výkon úložiště při ETL a ELT?
Jak rozdělit dotaz na etapy? Co pro to děláme?