Papaskokite apie replikacijos konfigūracijos užduotį, kurią sprendėte.
Data Engineer
Kokiais atvejais taikoma normalizacija, o kokiais - denormalizacija?
Kaip išvengti/pašalinti duomenų iškraipymą Spark?
Koks yra diagnostikos algoritmas ir ką daryti, jei užklausa vis dar lėta po kelių indeksų pridėjimo?
Kas yra normalizacija ir ER modelis, kam jie reikalingi?
Papaskokite apie Kafka pagrindines sąvokas (vartotojų grupė, skaidiniai, temos).
Kokios yra įprastos priežastys, kodėl užklausa reliacinėje duomenų bazėje veikia lėtai?
Kokios neaiškios problemos gali iškilti įkeliant dideles lenteles (išskyrus našumą)?
Pasiūlykite sprendimą reguliariai inkrementaliai įkelti didelę lentelę su lankstia (keičiamą) atnaujinimo dažnumu iš Postgres į Data Lake.
Kaip susijęs lango funkcijos viduje esantis rūšiavimas ir užklausos galutinis ORDER BY rūšiavimas?
Kaip valdyti Spark programos išteklius, kad neperkrautume atminties keičiant įvesties duomenų kiekį?
Kaip dirbti su skaidalais naudojant coalesce ir repartition?
Kokius Docker vaizdus reikėjo sukurti ir kodėl?
Ar yra kitų shuffle valdymo mechanizmų, išskyrus coalesce/repartition?
Kokie Spark JDBC parametrai buvo naudojami skaitymo paralelizavimui?