Data Vault yra patogus įrankis, bet objektų yra per daug. Ar gali paaiškinti skirtumą tarp hub'ų, link'ų ir satelitų?
Data Engineer
Gali paaiškinti, ką čia galiausiai gausime? Reikia paaiškinti kiekvieną žingsnį, kaip tai veikia.
Šioje schemoje Trino atsakingas už duomenų apdorojimą — kaip technologijų sluoksnis leidžia atskirti saugyklą ir skaičiavimus?
Ar žinote Rust kalba parašytą daugiasraigtinę, labai greitą biblioteką, kuri galėtų pakeisti Pandas?
Kuo skiriasi CTE nuo subužklausos?
Kokias technologijas naudojote duomenims įkelti į Parquet ir kokie mechanizmai buvo naudojami duomenims gauti ir įkelti?
Kaip suskirstyti užklausą į etapus? Ką darome tam?
Su srautu Iceberg veikė, girdėjai? Tai šiukšlių failų saugykla.
Kaip parašei Airflow DAG ir užduotis: rankiniu būdu ar naudojant šablonus?
Kaip duomenys iš išorinės lentelės buvo įkeliami į tikslines lenteles?
Ar įkėlėte duomenis iš Spark į S3 Parquet formatu, o tada iš Parquet į Greenplum — kaip vyksta įkėlimo procesas?
Tai yra realiu laiku, kaip tai įgyvendinti tarp Kafka ir ClickHouse Spark?
Su priklausomybėmis tarp darbų, tarp DAG-ų — ar naudojote jutiklius, kad jie vienas po kito būtų paleisti?
Kaip paprastai kūrei duomenų bazės schemą — ar tai darydavai rankomis tiesiai duomenų bazėje, ar saugodavai skriptus kažkur, ar visai naudoji Liquibase? Koks buvo procesas?
Ar turi prasmės naudoti CTE, jei ji naudojama tik kartą užklausoje?
Mes analizuosime JSON — kas analizuos JSON? Kiek žinau, ClickHouse nėra funkcijų.
Ar reikėjo dirbti tiesiogiai su Spark? Kuo jis neigiamas?
Ar dirbote su Git? Ką saugojote Git'e?
Mums reikia pipeline variklio — mechanizmo, kuris leidžia labai greitai kurti srautus pateikiant sutartis ir parametrus. Kaip tai įgyvendintum aukštesniame lygyje?
Kokio tipo skaitymas naudojamas Greenplum: eilutės ar stulpelio?