Data Engineer
Kas yra normalizavimas ir denormalizavimas, kada jie yra reikalingi?
Pateikite pavyzdį apie įprastą DAG rašymo užduotį Airflow.
Kas įvyko ir kaip atkurti darbą?
Kas yra ACID? Ką reiškia kiekviena raidė? Kaip tai susiję su sandoriais?
Įvertinkite galutinį sprendimą pagal laiką ir atmintį.
Kiek realistiški yra įmonės planai sukurti duomenų rinkimo, normalizavimo ir analizės sistemą?
Kuo skiriasi EXPLAIN ANALYZE nuo įprasto EXPLAIN? Kodėl nerekomenduojama jį vykdyti DELETE/UPDATE užklausose?
Paaiškinkite tinginius ir nedelinius skaičiavimus Spark.
Hive'e įvyko lėtas analitinis užklausa. Kaip suprasti, kas su ja nutiko ir kaip ją pataisyti?
Kokį išteklių labiausiai sunaudoja Nested Loop Join?
Gali paaiškinti, ką čia galiausiai gausime? Reikia paaiškinti kiekvieną žingsnį, kaip tai veikia.
Yra T1 (10 eilutės) ir T2 (5 eilutės) lentelės, abi su ID lauku. Kiek eilučių gali būti maksimaliai ir minimaliu atveju išėjime atliekant INNER JOIN ir LEFT JOIN šių lentelių?
Ką reikia patikrinti, jei žurnalai neatsidaro (klaida 403)?
Kokiu etapu, kokie patikrinimai atliekami ir kas vyksta su nevalidiais duomenimis duomenų kokybės (Data Quality) patikros metu?
Data Vault yra patogus įrankis, bet objektų yra per daug. Ar gali paaiškinti skirtumą tarp hub'ų, link'ų ir satelitų?
Kuo paprastai sudaryti Airflow užduočių žurnalai?
[vardas] pataisė klaidas ir stilių tekste: «Labas! Aš esu [vardas], anksčiau prašei pereiti į Telegram» — neformaliai, bet pagarbiškai
Kaip pridėti judančią vidurkį užsakymų sumos už dabartinę ir dvi ankstesnes dienas pagal vartotoją?
Kas yra shuffle Spark ir kam jis reikalingas?
Kokioje komandoje ir su kokiu vadovavimu jums yra patogiausia dirbti?