Data Engineer
Kokie fiziniai JOIN algoritmai veikia duomenų bazėse?
Papaskink apie savo Python lygį: ką naudojote, kaip giliai žinote objektinio programavimo
Kaip veikia Hash Join?
Kaip valdyti shuffle Spark'e (particionavimas, broadcast join ir kt.)?
Ar buvo papildomas registravimas, išskyrus Airflow žurnalus?
Ar administravote Airflow'ą ar tik dirbote kaip kūrėjas?
Ar esate susipažinęs su UDF (Naudotojo apibrėžtos funkcijos) ClickHouse, ar dirbote su jomis?
Ar jūs nustatėte žymas S3 ant kibirų ar objektų?
Ar rašėte vienetinius testus? Ar turite tokią patirtį?
Papaskink apie savo ankstesnį projektą, kokios buvo tavo pareigos?
Turime ORDER BY pagal užsakymų skaičių, ir yra du užsakymai po 5, dar du po 3. Kaip elgsis RANK() ir DENSE_RANK()?
Kuris komandas iš projekto pagrindinio katalogo turėtų būti naudojamas norint atnaujinti submodulį docs/ į naujausią versiją iš nuotolinio saugyklos ir paruošti šią pakeitimą į commit? git fetch docs/ && git merge docs/FETCH_HEAD git pull --recurse-submodules git submodule update --remote docs/ cd docs/ && git pull && cd .. && git commit -am "Atnaujinimas" git submodule update --init docs/
Ar turite patirties rašant dokumentaciją?
Kuo skiriasi Parquet saugojimo formatas nuo CSV?
Kokia tavo patirtis ir supratimas apie pultinių statybą vitrinų skaičiavimui (duomenų apdorojimas)?
Jei nustatome filtravimo sąlygą pagal sandorio datą WHERE (po LEFT JOIN), ar tai apribos rezultatą pirmojoje lentelėje (klientai)?
Ar turite patirties konfigūruojant pipeline'us CI/CD, pavyzdžiui, GitLab?
Kuriate audit_logs lentelę, kurioje reikia saugoti datą ir tikslų laiką su laiko juosta. Koks duomenų tipas yra tinkamiausias? laiko juosta su laiko zona intervalas timestamp su laiko juosta data timestamp be laiko juostos
Pasakokite apie geriausias praktikas naudojant indeksus – kada ir kaip dažnai juos naudoti.
Su srautu Iceberg veikė, girdėjai? Tai šiukšlių failų saugykla.