Sobes.tech

Data Engineer

Šajā shēmā Trino ir atbildīgs par datu apstrādi — kā tehnoloģiju slānis ļauj atdalīt glabātuvi un aprēķinus?

192

Kādi procesi tiek uzsākti, kad dzēšam vai mainām ierakstus ClickHouse?

187

Kā atšķiras CTE no apakšvaicājuma?

185

Kā sadalīt pieprasījumu posmos? Ko darām tam?

184

Vai jūs zināt Rust valodā uzrakstītu daudzprocesuālu, ļoti ātru bibliotēku, kas var aizstāt Pandas?

184

Ar ar darba starpā, starp DAG — izmantojāt sensorus, lai tie viens pēc otra tiktu palaisti?

183

Kuras tehnoloģijas jūs izmantojāt, lai iegūtu un ielādētu datus Parquet, un kādi mehānismi tika izmantoti datu iegūšanai un ielādei?

182

Kā tu uzrakstīji Airflow DAG un uzdevumus: ar roku vai ar šabloniem?

182

Vai jūs ielādējāt datus no Spark uz S3 Parquet formātā, un pēc tam no Parquet uz Greenplum — kā notiek ielādes process?

181

Kā parasti tu veidoji datu bāzes shēmu — vai to darīji tieši datu bāzē ar rokām, vai skriptus glabāji kaut kur, vai vispār izmantoji Liquibase? Kāds bija process?

181

Vai esat strādājis ar Git? Ko glabājāt Git?

180

Ar straumēšanu Iceberg darbojās, dzirdēji? Tā ir atkritumu failu glabātuve.

179

Kā dati no ārējās tabulas tika ielādēti galamērķa tabulās?

176

Tas ir reāllaikā, kā to īstenot starp Kafka un ClickHouse Spark?

172

Vai ir jēga izmantot CTE, ja tā tiek izmantota tikai vienu reizi vaicājumā?

171

Vai jums nācās tieši strādāt ar Spark? Kāds ir tā trūkums?

169

Mums nepieciešams pipeline dzinējs — mehānisms, kas ļauj ļoti ātri veidot plūsmas, ievadot līgumus un parametrus. Kā tu to realizētu augstākā līmenī?

167

Mēs analizēsim JSON — kurš analizēs JSON? Cik zinu, ClickHouse nav funkciju.

166

Iceberg ir dzinējs, kas ļauj S3 pārvērst datu bāzē, tas pat ievēro ACID. Kāds ir tā trūkums?

163
/3