Rääkige replikatsiooni seadistamise ülesandest, mille te lahendasite.
Data Engineer
Millistel juhtudel rakendatakse normaliseerimist ja millistel denormaliseerimist?
Kuidas vältida/eemaldada andmete kallutatust Sparkis?
Milline on diagnostika algoritm ja mida teha, kui päring on endiselt aeglane pärast mitme indeksi lisamist?
Mis on normaliseerimine ja ER-mudel, milleks need on vajalikud?
Rääkige Kafka põhikontseptsioonidest (tarbijarühm, jaotised, teemad).
Millised on tüüpilised põhjused, miks päring relatsioonandmebaasis töötab aeglaselt?
Millised ebatüüpilised probleemid võivad tekkida suurte tabelite laadimisel (välja arvatud jõudlus)?
Pakun proposed solution for regular incremental loading of a large table with flexible (changeable) update frequency from Postgres to Data Lake.
Kuidas on seotud akna funktsiooni sees olev sortimine ja päringus lõplik ORDER BY sortimine?
Kuidas hallata Spark rakenduse ressursse, et mitte üle kulutada mälu sisendandmete mahu muutmisel?
Kuidas töötada partitsioonidega coalesce ja repartition abil?
Milliseid Docker-pilte pidi ehitama ja miks?
Kas on veel shuffle'i haldamise mehhanismeid peale coalesce/repartition?
Millised Spark JDBC parameetrid kasutati lugemise paralleelimiseks?