Kaip gerai pažįstate Linux/Docker?
Data Engineer
Kas yra shuffle Spark ir kam jis reikalingas?
Kaip valdyti shuffle Spark'e (particionavimas, broadcast join ir kt.)?
Ką suteikia Iceberg formatas lyginant su įprastu Parquet?
Ar pažįstate bendrųjų lentelių išraiškas (CTE)? Pateikite naudojimo pavyzdį.
Ką reiškia statistika duomenų bazių valdymo sistemose ir užklausų optimizavime?
Kaip Linux'e rasti eilutės dalį konkrečioje log failo stulpelyje (pavyzdžiui, datą trečiame stulpelyje)?
[vardas] pasakojo apie savo patirtį dirbant su įvairiomis duomenų bazių valdymo sistemomis, kiek gilintis reikėjo į optimizaciją ir vidinius detalius.
Detaliai aprašykite inkremento gaudymo algoritmą iš šaltinio, kad nieko neprarastų keičiant įkėlimo dažnį.
Kaip organizuoti vieno pranešimo skaitymą iš Kafka kelių skirtingų vartotojų (fan-out)?
Kaip išspręsti problemą, kai skaitymo procesas gali matyti tarpinį (nesuderintą) lentelės būseną daugiaetapiame ETL (delete+insert) Iceberg'e?
Kas yra "mirusi pora" (dead tuple)?
Kaip susijusios Spark skaidymo dalys ir skaidymo dalys lentelėse (pavyzdžiui, Iceberg)?
Kaip palyginti pradinį („gyvą“) ir tikslinį sąrašą, jei šaltinis nuolat keičiasi?
Pasakokite apie geriausias praktikas naudojant indeksus – kada ir kaip dažnai juos naudoti.
Kas yra Spark JDBC ir kaip efektyviai įkelti didelį lentelę per jį?
Kaip aptikti duomenų iškraipymą (data skew) Spark?
Kas yra transakcijų žurnalas (WAL) duomenų bazės valdymo sistemoje ir kam jis reikalingas?
Ar buvo naudojama įrašų hash'ų palyginimo metodas, kad būtų apskaičiuotas skirtumas tarp šaltinio ir tikslo lentelės?
Kam skirta cache ir persist Spark'e?