Povestiți despre sarcina de configurare a replicării pe care ați rezolvat-o.
Data Engineer
Ce este normalizarea și modelul ER, la ce sunt utile?
Cum să eviți/să elimini biasul datelor în Spark?
În ce cazuri se aplică normalizarea și în care denormalizarea?
Care este algoritmul de diagnostic și ce trebuie făcut dacă interogarea rămâne lentă după adăugarea mai multor indecși?
Vorbiți despre conceptele de bază ale Kafka (grupul de consumatori, partiții, subiecte).
Care sunt cauzele tipice pentru ca o interogare într-o bază de date relațională să funcționeze lent?
Ce probleme neobișnuite pot apărea la încărcarea tabelelor mari (în afară de performanță)?
Propuneți o soluție pentru încărcarea incrementală regulată a unui tabel mare cu o frecvență de actualizare flexibilă (modificabilă) din Postgres în Data Lake.
Cum sunt legate sortarea din interiorul funcției de fereastră și sortarea finală ORDER BY din interogare?
Cum să gestionezi resursele unei aplicații Spark pentru a nu depăși memoria atunci când modifici volumul datelor de intrare?
Cum să lucrezi cu partițiile prin coalesce și repartition?
Ce imagini Docker a fost nevoie să construiți și de ce?
Există alte mecanisme de gestionare a shuffle-ului în afară de coalesce/repartition?
Ce parametri Spark JDBC au fost utilizați pentru paralelizarea citirii?