Koliko dobro poznaješ Linux/Docker?
Data Engineer
Šta je shuffle u Spark-u i čemu služi?
Kako upravljati shuffle u Spark-u (particionisanje, broadcast join itd.)?
Šta donosi format Iceberg u poređenju sa običnim Parquet-om?
Да ли сте упознати са заједничким изразима табела (CTE)? Наведите пример употребе.
Kako pronaći podniz u određenoj koloni log fajla u Linuxu (npr. datum u trećoj koloni)?
Šta je statistika u kontekstu sistema za upravljanje bazama podataka i optimizacije upita?
[ime] je govorio o svom iskustvu sa različitim sistemima za upravljanje bazama podataka, koliko je morao da se bavi optimizacijom i unutrašnjim detaljima.
Detaljno opišite algoritam hvatanja inkrementa sa izvora tako da ništa ne bude izgubljeno pri promeni frekvencije učitavanja.
Kako organizovati čitanje iste poruke iz Kafka od strane više različitih potrošača (fan-out)?
Kako rešiti problem kada proces čitanja može videti međustanje (neusklađeno) stanje tabele tokom višestepenog ETL (delete+insert) u Iceberg?
Šta je "mrtvi tork" (dead tuple)?
Kako uporediti izvornu („živu“) i ciljnu tabelu ako se izvor stalno menja?
Šta je Spark JDBC i kako efikasno učitati veliku tabelu putem njega?
Kako su povezane Spark particije i particije u tabelama (npr. u Iceberg)?
Ispričajte o najboljim praksama za korišćenje indeksa - kada i koliko često ih koristiti.
Šta je dnevnik transakcija (WAL) u SGBD-u i čemu služi?
Da li je metoda poređenja heševa zapisa korišćena za izračunavanje razlike između izvora i ciljne tabele?
Kako detektovati neravnotežu podataka (data skew) u Spark-u?
Zašto su cache i persist potrebni u Spark-u?