Data Engineer
Cu ce instrumente de vizualizare ați lucrat și cât de strâns ați colaborat cu Power BI?
Ai lucrat cu gestionarii de context în Python? Ce sunt și pentru ce sunt folosiți?
Ce știi despre serializare și deserializare în contextul Spark/UDF?
Vorbește-mi despre înțelegerea ta asupra calității datelor — ai experiență în acest domeniu?
Povesti despre locul tău de muncă actual: produsul principal, funcționalitatea ta.
Ce întrebări ai pentru mine?
Ați efectuat un logging suplimentar în afară de jurnalele Airflow?
Funcția de fereastră SUM() OVER (PARTITION BY user_id) — într-o situație adăugăm ORDER BY data achiziției, în alta nu. Care este diferența?
Ce tip de stocare are Parquet: pe rând sau pe coloană?
De ce cauți un loc de muncă nou și ce ai dori să faci în viitor?
Ce strategii de distribuție a datelor există?
Ce te atrage în domeniul travel? Poate îți place să călătorești tu însuți, sau travel-tech te-a interesat într-un fel sau altul?
De ce cauți acum un loc de muncă nou, vrei să schimbi locul de muncă?
Propuneți o soluție pentru încărcarea incrementală regulată a unui tabel mare cu o frecvență de actualizare flexibilă (modificabilă) din Postgres în Data Lake.
Și dacă avem nevoie de toți clienții, chiar dacă nu au avut tranzacții în acea dată, cum îi afișăm?
Ai lucrat cu feature store-uri?
Pe ce câmpuri a avut loc unirea datelor și cum au fost eliminate duplicatele din vitrină?
LeetCode #? — În PostgreSQL există un tabel [tabel] cu o singură coloană id și valori 1, 1, 2. Scrieți o interogare DELETE care să elimine fizic un duplicat.
Ce imagini Docker a fost nevoie să construiți și de ce?
Ai avut o problemă cu fusurile orare la citirea timestamp-urilor prin PXF din Parquet?