Sobes.tech

Data Engineer

Kādus papildu parametrus DDL/CREATE TABLE ClickHouse jūs zināt, uz ko tie ietekmē un kādos gadījumos tie tiek izmantoti?

198

Kā tika izveidotas klastera tabulas un kā tika risināta problēma, kad ZooKeeper dēļ trūka replikas uz viena shard?

189

Kā nevienmērīgi sadalīt šīs vitriņas datus trīs shardos: 50% pirmajā un pa 25% pārējos divos?

189

Kā jūs risinājāt optimizācijas problēmas, kad vaicājums ilgstoši darbojas un veic pilnu skenēšanu? Kā pieietu jaunai līdzīgai uzdevumam?

175

Kādos gadījumos Materialized View ClickHouse var izlaist datus vai, gluži pretēji, dublēt tos?

169

Vai esat kādreiz saskārušies ar ClickHouse `Too many parts` kļūdu ievietošanas laikā? Kā to risinājāt?

165

Ar kurām Python bibliotēkām jūs strādājāt?

162

Pastāstiet vairāk par datu izliekumu starp shardiem: kā tas tika noteikts un kā tika izmantota atbilstošā funkcija/mekanisms?

160

Vai jūs esat iepazinies ar UDF (Lietotāja definētas funkcijas) ClickHouse, vai esat ar tām strādājis?

141

Kā jūs labojāt datu novirzi ar client_id, kad viens klients bija būtiski lielāks par pārējiem? Kādas ir iespējas?

138

Ar kādiem Distributed motora parametriem jūs esat iepazinies ClickHouse?

131

Kā jūs rīkotos ar Materialized View ķēdi caur starpposma ReplacingMergeTree tabulu, lai pareizi aizpildītu jau esošos datus pirms jaunas MV palaišanas?

129

Kādās laukos notika datu apvienošana un kā tika izņemti dublikāti no vitrina?

125

Kā organizēt datu ielādi ClickHouse lielā PostgreSQL tabulā, kur pastāvīgi ienāk jauni ieraksti ar monotoniski pieaugošu primāro atslēgu?

124

Vai jūs pazīstat ReplicatedQueue? Vai jums ir pieredze ar tās izmantošanu?

113