Meséljen a replikáció beállítási feladatról, amit megoldott.
Data Engineer
Mi az a normalizáció és az ER-modell, mire jók?
Hogyan kerülhető el/űrül ki az adatok torzítása a Sparkban?
Milyen esetekben alkalmazzák a normalizálást, és milyen esetekben a denormalizálást?
Milyen diagnosztikai algoritmus és mit tegyünk, ha a lekérdezés továbbra is lassú több index hozzáadása után?
Beszéljen a Kafka alapfogalmairól (fogyasztói csoport, partíciók, témák).
Milyen jellemző okai vannak annak, hogy egy lekérdezés egy relációs adatbázisban lassan működik?
Milyen nem nyilvánvaló problémák merülhetnek fel nagy táblák betöltésekor (teljesítményen kívül)?
Javasolja meg egy nagy tábla rendszeres inkrementális betöltésének megoldását rugalmas (változtatható) frissítési gyakorisággal a Postgres-ból a Data Lake-be.
Hogyan kapcsolódik a rendezés az ablakfüggvényen belül és a végső ORDER BY rendezéshez a lekérdezésben?
Hogyan kezeljük a Spark alkalmazás erőforrásait, hogy ne fogyasszunk túl memóriát az bemeneti adatok mennyiségének változásakor?
Hogyan dolgozzunk partíciókkal a coalesce és repartition segítségével?
Milyen Docker-képfájlokat kellett összeállítanod, és miért?
Vannak más shuffle-kezelési mechanizmusok a coalesce/repartition mellett?
Milyen Spark JDBC paramétereket használtak az olvasás párhuzosításához?