Jak dobře znáte Linux/Docker?
Data Engineer
Co je shuffle v Spark a k čemu je potřeba?
Jak lze spravovat shuffle v Spark (particionace, broadcast join atd.)?
Co přináší formát Iceberg ve srovnání s běžným Parquetem?
Znáte společné výrazy tabulek (CTE)? Uveďte příklad použití.
Co je statistika v kontextu systémů správy databází a optimalizace dotazů?
Jak najít podřetězec v konkrétní sloupci logového souboru v Linuxu (například datum ve třetím sloupci)?
[jméno] mluvil o své zkušenosti s různými systémy správy databází, jak hluboko musel zabývat optimalizací a vnitřními detaily.
Jak zorganizovat čtení stejné zprávy z Kafka několika různými spotřebiteli (fan-out)?
Podrobně popište algoritmus zachycení inkrementu ze zdroje tak, aby při změně frekvence načítání nedošlo ke ztrátě.
Jak vyřešit problém, když čtecí proces může během vícestupňového ETL (delete+insert) v Iceberg vidět mezistav (nesouladný) stavu tabulky?
Co je to "mrtvá n-tice" (dead tuple)?
Jak jsou spojeny partice Spark a partice v tabulkách (například v Iceberg)?
Jak porovnat původní („živou“) a cílovou tabulku, pokud se zdroj neustále mění?
Povězte o nejlepších postupech při používání indexů - kdy a jak často je používat.
Co je Spark JDBC a jak efektivně načíst velkou tabulku přes něj?
Jak detekovat nerovnováhu dat (data skew) v Spark?
Co je to transakční protokol (WAL) v SGBD a k čemu slouží?
Byla použita metoda porovnání hashů záznamů k výpočtu rozdílu mezi zdrojem a cílovou tabulkou?
Na co jsou v Sparku cache a persist?