Kas Greenplumis järgib ACID-i?
Data Engineer
Millised protsessid käivituvad, kui me kustutame või muudame kirjeid ClickHouse'is?
Data Vault on mugav tööriist, kuid objekte on liiga palju. Kas sa saad seletada erinevust hubide, linkide ja satelliitide vahel?
Kas tead, kas on Rustis kirjutatud mitmetöötlus, väga kiire raamatukogu, mis võiks asendada Pandas?
Kuidas erineb CTE alamsisest päringust?
Kuidas jagada päring etappideks? Mida selleks teeme?
Milliseid tehnoloogiaid kasutasite andmete saamiseks ja laadimiseks Parquet'i ning milliseid mehhanizme kasutati andmete saamiseks ja laadimiseks?
Kas olete andmeid Sparkist S3-ile Parquet-formaadis üles laadinud ja seejärel Parquetist Greenplumisse — kuidas laadimisprotsess toimub?
Kuidas sa kirjutasid Airflow DAG-i ja ülesanded: käsitsi või mallide abil?
Kuidas laaditi andmed välisest tabelist sihttabelitesse?
Kas te olete töötanud Gitiga? Mida hoidsite Gitis?
Kuidas sa tavaliselt andmebaasi skeemi koostasid — kas tegid seda käsitsi otse andmebaasis või hoidsid skripte kuskil või kas üldse kasutasid Liquibase'i? Mis oli protsess?
Striiminguga töötas Iceberg, kas sa kuulsid? See on prügikasti failide salvestus.
Tööde vahel, DAG-ide vahel — kas kasutasite sensoreid, et nad töötaksid üksteise järel?
See on reaalajas, kuidas seda Kafka ja ClickHouse Spark vahel rakendada?
Kas on mõtet kasutada CTE, kui seda kasutatakse ainult üks kord päringus?
Me analüüsime JSON — kes analüüsib JSON-i? Kui ma tean, ClickHouse'is funktsioone pole.
Kas teil tuli otse Sparkiga töötada? Mis on selle miinus?
Iceberg on mootor, mis võimaldab S3-st teha andmebaasi, ta isegi järgib ACID-i. Mis on selle miinus?
Meil on vaja pipeline-mootorist — mehhanismist, mis võimaldab väga kiiresti voogusid luua, sisestades lepinguid ja parameetreid. Kuidas sa seda kõrgemal tasandil rakendaksid?