Data Engineer
Jaká jsou omezení při používání hash tabulek?
Dána jsou dvě tabulky t1 a t2. Úkolem je vypsat všechny druhy joinů, které znáte, a výsledek dotazu select * from t1 <join> t2 on t1.t = t2.t pro každý z nich. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null cross 1 1 - null null - INNER JOIN [phone] LEFT JOIN 1 - 1 2 - NULL 4 - NULL NULL - NULL RIGHT JOIN [phone] NULL - 3 NULL - NULL NULL - NULL FULL JOIN [phone] - NULL 4 - NULL NULL - 3 null - NULL null - NULL null - NULL
Jaké jsou nevýhody architektury MPP v Greenplum?
Jaké jsou vaše očekávání ohledně platu?
Jak může dojít k SQL injection přes pole pro zadání data?
Zobrazuje sledování pouze REST požadavky nebo něco jiného?
Co děláte, když narazíte na problém v produkčním pipeline?
Jak obnovit práci z vzdálené větve, pokud při pokusu o `git checkout hotfix/missing-footer` obdržíte chybovou zprávu, že větev nebyla nalezena?
Jak fungovaly analytické funkce (okenní funkce)?
Jaké typy tabulek jste v Greenplum používal? V jakých případech se používal heap a v jakých Append-Optimized?
V čem se HDFS liší od běžných distribuovaných souborových systémů?
Jedná se o v reálném čase, jak to realizovat mezi Kafka a ClickHouse Spark?
Měly problémy s OpenAPI při přechodu ze Spring Boot 2 na 3?
Jak funguje MapReduce, zejména fáze Reduce?
Co se děje při paralelizaci dotazů v jednom uzlu Postgres?
Jak lze přenést data z Greenplum a Trino do ClickHouse?
Jaké jsou výhody a nevýhody ACID, kromě rychlosti čtení?
Na co jsou indexy, jaké jsou jejich výhody a nevýhody?
Jak funguje rozdělení v Hive a jak je fyzicky znázorněno v souborovém systému?
Pověz mi o sobě — pracovní zkušenosti, technologický stack