Povedzte nám o úlohe s nastavením replikácie, ktorú ste riešili.
Data Engineer
V ktorých prípadoch sa používa normalizácia a v ktorých denormalizácia?
Ako sa vyhnúť/odstrániť skreslenie údajov v Spark?
Aký je diagnostický algoritmus a čo robiť, ak je dopyt stále pomalý po pridaní niekoľkých indexov?
Čo je normalizácia a ER model, na čo slúžia?
Povedajte o základných konceptoch Kafka (skupina spotrebiteľov, oddiely, témy).
Aké sú typické príčiny toho, že dopyt v relačnej databáze funguje pomaly?
Aké nejasné problémy môžu nastať pri načítaní veľkých tabuliek (okrem výkonu)?
Navrhnite riešenie pre pravidelné inkrementálne načítanie veľkej tabuľky s flexibilnou (meniteľnou) frekvenciou aktualizácie z Postgres do Data Lake.
Ako súvisí zoradenie vo vnútri okna funkcie a konečné zoradenie ORDER BY v dopyte?
Ako spravovať zdroje Spark aplikácie, aby ste neprekročili pamäť pri zmene objemu vstupných dát?
Ako pracovať s partíciami pomocou coalesce a repartition?
Aké Docker obrazy ste museli zostaviť a prečo?
Existujú iné mechanizmy riadenia shuffle okrem coalesce/repartition?
Aké parametre Spark JDBC boli použité na paralelné čítanie?