Ako dobre poznáte Linux/Docker?
Data Engineer
Čo je shuffle v Spark a na čo je potrebný?
Ako spravovať shuffle v Spark (particionovanie, broadcast join atď.)?
Čo prináša formát Iceberg v porovnaní s bežným Parquetom?
Poznáte spoločné výrazy tabuliek (CTE)? Uveďte príklad použitia.
Čo je štatistika v kontexte systémov správy databáz a optimalizácie dopytov?
Ako nájsť podreťazec v konkrétnom stĺpci log súboru v Linuxe (napríklad dátum v treťom stĺpci)?
[meno] hovoril o svojej skúsenosti s rôznymi systémami správy databáz, do akej miery sa musel zaoberať optimalizáciou a vnútornými detailmi.
Ako zorganizovať čítanie rovnakej správy z Kafka viacerými rôznymi spotrebiteľmi (fan-out)?
Podrobne opíšte algoritmus zachytenia inkrementu zo zdroja, aby nič nebolo stratené pri zmene frekvencie načítania.
Ako rešite problem, keď čítací proces môže vidieť medzičasový (nesúladný) stav tabuľky počas viacstupňového ETL (delete+insert) v Iceberg?
Čo je "mŕtva n-tica" (dead tuple)?
Ako sú spojené partície Spark a partície v tabuľkách (napríklad v Iceberg)?
Ako porovnať pôvodnú („živú“) a cieľovú tabuľu, ak sa zdroj neustále mení?
Porozprávajte o najlepších praktikách používania indexov - kedy a ako často ich používať.
Čo je Spark JDBC a ako efektívne načítať veľkú tabuľu cez neho?
Ako detegovať nerovnováhu dát (data skew) v Spark?
Čo je to transakčný denník (WAL) v systéme správy databáz? A prečo je potrebný?
Bola použitá metóda porovnávania hashov záznamov na výpočet rozdielu medzi zdrojom a cieľovou tabuľou?
Na čo sú v Spark cache a persist?