Koje dodatne parametre DDL/CREATE TABLE u ClickHouse poznajete, na šta utiču i u kojim slučajevima se koriste?
Data Engineer
Kako su kreirane tabele u klasteru i kako ste rešili problem kada je zbog ZooKeeper-a nedostajala replika na shard-u?
Kako neravnomerno rasporediti podatke ove vitrine na tri shard-a: 50% na prvom i po 25% na preostala dva?
Kako ste tačno čitali Parquet?
Kako ste rešavali probleme optimizacije kada zahtev traje dugo i vrši puni sken? Kako biste pristupili novom takvom zadatku?
У којим случајевима Materialized View у ClickHouse може пропустити податке или, обратно, дуплирати их?
Da li ste ikada naišli na grešku ClickHouse `Too many parts` prilikom ubacivanja? Kako ste je rešili?
Са којим Python библиотекама сте радили?
Ispričajte više o neravnoteži podataka između shardova: kako je određena i kako je korišćena odgovarajuća funkcija/mehanizam?
Da li ste upoznati sa UDF (Funkcije koje definiše korisnik) u ClickHouse-u, da li ste radili sa njima?
Kako ste ispravili pristrasnost podataka po client_id kada je jedan klijent bio znatno veći od ostalih? Koje su opcije?
Са којим параметрима Distributed мотора у ClickHouse-у сте упознати?
Kako biste postupili sa nizom Materialized View preko međuzbne ReplacingMergeTree tabele da pravilno popunite podatke koji već postoje pre pokretanja nove MV?
Sa kojom verzijom Airflow ste radili?
Na kojim poljima je došlo do spajanja podataka i kako su se u vitrinama uklanjali duplikati?
Kako organizovati učitavanje podataka u ClickHouse u velikoj PostgreSQL tabeli u koju stalno stižu novi zapisi sa monotonno rastućim primarnim ključem?
Да ли сте упознати са ReplicatedQueue? Да ли имате искуства са њом?