Sobes.tech

Data Engineer

Data Vault yra patogus įrankis, bet objektų yra per daug. Ar gali paaiškinti skirtumą tarp hub'ų, link'ų ir satelitų?

187

Gali paaiškinti, ką čia galiausiai gausime? Reikia paaiškinti kiekvieną žingsnį, kaip tai veikia.

186

Šioje schemoje Trino atsakingas už duomenų apdorojimą — kaip technologijų sluoksnis leidžia atskirti saugyklą ir skaičiavimus?

186

Ar žinote Rust kalba parašytą daugiasraigtinę, labai greitą biblioteką, kuri galėtų pakeisti Pandas?

184

Kokias technologijas naudojote duomenims įkelti į Parquet ir kokie mechanizmai buvo naudojami duomenims gauti ir įkelti?

178

Kaip suskirstyti užklausą į etapus? Ką darome tam?

175

Su srautu Iceberg veikė, girdėjai? Tai šiukšlių failų saugykla.

173

Kaip parašei Airflow DAG ir užduotis: rankiniu būdu ar naudojant šablonus?

173

Kaip duomenys iš išorinės lentelės buvo įkeliami į tikslines lenteles?

171

Ar įkėlėte duomenis iš Spark į S3 Parquet formatu, o tada iš Parquet į Greenplum — kaip vyksta įkėlimo procesas?

171

Tai yra realiu laiku, kaip tai įgyvendinti tarp Kafka ir ClickHouse Spark?

170

Su priklausomybėmis tarp darbų, tarp DAG-ų — ar naudojote jutiklius, kad jie vienas po kito būtų paleisti?

169

Kaip paprastai kūrei duomenų bazės schemą — ar tai darydavai rankomis tiesiai duomenų bazėje, ar saugodavai skriptus kažkur, ar visai naudoji Liquibase? Koks buvo procesas?

169

Ar turi prasmės naudoti CTE, jei ji naudojama tik kartą užklausoje?

169

Mes analizuosime JSON — kas analizuos JSON? Kiek žinau, ClickHouse nėra funkcijų.

164

Ar reikėjo dirbti tiesiogiai su Spark? Kuo jis neigiamas?

163

Ar dirbote su Git? Ką saugojote Git'e?

162

Mums reikia pipeline variklio — mechanizmo, kuris leidžia labai greitai kurti srautus pateikiant sutartis ir parametrus. Kaip tai įgyvendintum aukštesniame lygyje?

161

Kokio tipo skaitymas naudojamas Greenplum: eilutės ar stulpelio?

159
/3