Data Engineer
Ce este normalizarea și denormalizarea, când sunt necesare?
Dă un exemplu de sarcină tipică pentru scrierea unui DAG în Airflow.
Ce s-a întâmplat și cum se poate recupera munca?
Ce este ACID? Ce înseamnă fiecare literă? Cum se raportează la tranzacții?
Evaluați soluția finală în ceea ce privește timpul și memoria.
Cât de realiste sunt planurile companiei de a construi un sistem de colectare, normalizare și analiză a datelor?
Care este diferența dintre EXPLAIN ANALYZE și un EXPLAIN obișnuit? De ce nu este recomandat să îl rulezi pe interogări DELETE/UPDATE?
Explicați calculurile leneșe și imediate în Spark.
A fost o interogare analitică lentă în Hive. Cum să înțelegi ce s-a întâmplat cu ea și cum să o repari?
Care resursă este consumată cel mai mult la Nested Loop Join?
Poți să explici ce vom obține în final aici? Este necesar să comentezi fiecare pas, cum funcționează.
Care poate fi numărul maxim și minim de rânduri în rezultat la INNER JOIN și LEFT JOIN ale acestor tabele, având T1 10 rânduri și T2 5 rânduri, ambele cu câmpul ID?
Ce trebuie verificat dacă jurnalele nu se deschid (eroare 403)?
Verificări ale calității datelor — în ce etapă, ce verificări, ce se întâmplă cu datele nevalide?
Data Vault este un instrument util, dar devine prea mult de obiecte. Poți explica diferența dintre hub-uri, link-uri și sateliți?
Din ce sunt de obicei compuse jurnalele de sarcini Airflow?
[nume] a corectat greșelile și stilul în text: «Salut! Sunt [nume], ai cerut anterior să treci pe Telegram» — într-un mod informal, dar respectuos
Cum adaug o medie mobilă a sumei comenzilor pentru ziua curentă și cele două zile anterioare pe utilizator?
Ce este shuffle în Spark și la ce folosește?
În ce echipă și sub ce conducere te simți cel mai confortabil să lucrezi?