Ispričajte o zadatku podešavanja replikacije koji ste rešili.
Data Engineer
Šta je normalizacija i ER model, čemu služe?
Kako izbeći/ukloniti pristrasnost podataka u Spark-u?
U kojim slučajevima se primenjuje normalizacija, a u kojim denormalizacija?
Koji je algoritam dijagnostike i šta treba uraditi ako je upit i dalje spor nakon dodavanja više indeksa?
Ispričajte o osnovnim konceptima Kafka (grupa potrošača, particije, teme).
Koji su tipični razlozi zbog kojih upit u relacijskoj bazi podataka radi sporo?
Koji nejasni problemi mogu nastati prilikom učitavanja velikih tabela (osim performansi)?
Predložite rešenje za redovno inkrementalno učitavanje velike tabele sa fleksibilnom (menjajućom) frekvencijom ažuriranja iz Postgres u Data Lake.
Kako su povezani sortiranje unutar funkcije prozora i završno sortiranje ORDER BY u upitu?
Kako upravljati resursima Spark aplikacije da ne prekoračimo memoriju pri promeni obima ulaznih podataka?
Kako raditi sa particijama putem coalesce i repartition?
Koje Docker slike ste morali da sastavite i zašto?
Postoje li još mehanizmi za upravljanje shuffle-om osim coalesce/repartition?
Koji su parametri Spark JDBC korišćeni za paralelno čitanje?