Data Engineer
Cu ce baze de date ați lucrat? Cum funcționează MongoDB și cum se scalează?
Se poate crea și aplica un decorator fără sintaxa @?
De ce ați decis să scoateți clasamentul într-un CTE separat? De ce nu putea fi folosit direct în primul CTE?
Cum ați determinat că înregistrarea există deja și nu este nevoie să o înregistrați din nou?
NULL plus 5 — cât va fi?
Se pot citi datele în paralel dintr-un singur fișier Parquet în Spark, sau doar cu un singur nucleu într-o sarcină?
Ce este RDD în Apache Spark și în ce se deosebește de alte abstracții Spark?
Ai făcut verificări statistice?
La ce sunt utile "dosarele"/prefixele în S3 în afară de comoditate?
Dacă programarea DAG este @daily, la ce oră se pornește efectiv?
Ce sunt decoratoarele în Python?
Cum a fost implementată tehnic descărcarea paralelă a unui tabel mare din PostgreSQL în Spark în cazul [context]?
Ce este un decorator în Python?
Cum se implementează distribuirea inegală a datelor în vitrină: 50% pe primul și câte 25% pe celelalte două?
Cum să luptăm cu inconsistența datelor?
Cum au fost create tabelele în cluster și cum a fost rezolvată problema atunci când, din cauza ZooKeeper, lipsea o replică pe un shard?
Cum monitorizai calitatea datelor?
Cum ați corectat biasul datelor pe client_id atunci când un client era semnificativ mai mare decât ceilalți? Care sunt opțiunile?
Din ce etape constă o tranzacție?
Cum să lucrezi cu partițiile prin coalesce și repartition?