Sobes.tech

Data Engineer

Millised protsessid käivituvad, kui me kustutame või muudame kirjeid ClickHouse'is?

187

Data Vault on mugav tööriist, kuid objekte on liiga palju. Kas sa saad seletada erinevust hubide, linkide ja satelliitide vahel?

187

Kas tead, kas on Rustis kirjutatud mitmetöötlus, väga kiire raamatukogu, mis võiks asendada Pandas?

184

Kuidas erineb CTE alamsisest päringust?

183

Kuidas jagada päring etappideks? Mida selleks teeme?

180

Milliseid tehnoloogiaid kasutasite andmete saamiseks ja laadimiseks Parquet'i ning milliseid mehhanizme kasutati andmete saamiseks ja laadimiseks?

180

Kas olete andmeid Sparkist S3-ile Parquet-formaadis üles laadinud ja seejärel Parquetist Greenplumisse — kuidas laadimisprotsess toimub?

177

Kuidas sa kirjutasid Airflow DAG-i ja ülesanded: käsitsi või mallide abil?

175

Kuidas laaditi andmed välisest tabelist sihttabelitesse?

175

Kas te olete töötanud Gitiga? Mida hoidsite Gitis?

174

Kuidas sa tavaliselt andmebaasi skeemi koostasid — kas tegid seda käsitsi otse andmebaasis või hoidsid skripte kuskil või kas üldse kasutasid Liquibase'i? Mis oli protsess?

173

Striiminguga töötas Iceberg, kas sa kuulsid? See on prügikasti failide salvestus.

173

Tööde vahel, DAG-ide vahel — kas kasutasite sensoreid, et nad töötaksid üksteise järel?

171

See on reaalajas, kuidas seda Kafka ja ClickHouse Spark vahel rakendada?

170

Kas on mõtet kasutada CTE, kui seda kasutatakse ainult üks kord päringus?

169

Me analüüsime JSON — kes analüüsib JSON-i? Kui ma tean, ClickHouse'is funktsioone pole.

166

Kas teil tuli otse Sparkiga töötada? Mis on selle miinus?

165

Iceberg on mootor, mis võimaldab S3-st teha andmebaasi, ta isegi järgib ACID-i. Mis on selle miinus?

161

Meil on vaja pipeline-mootorist — mehhanismist, mis võimaldab väga kiiresti voogusid luua, sisestades lepinguid ja parameetreid. Kuidas sa seda kõrgemal tasandil rakendaksid?

161
/3