Ի՞նչ լրացուցիչ պարամետրեր DDL/CREATE TABLE- ի մասին գիտեք ClickHouse-ում, դրանք ինչի վրա են ազդում և ինչ դեպքերում են օգտագործվում։
Data Engineer
Ինչպես ստեղծվեցին սեղանները կլաստերում և ինչպես լուծվեց խնդիրը, երբ ZooKeeper-ի պատճառով շարդում ռեպլիկը բաց էր:
Ինչպես անհամամասնորեն բաժանել այս վիտրինայի տվյալները երեք shard-ների վրա՝ 50% առաջինում և 25% մյուս երկուում?
Ինչպես եք դուք ճիշտ կարդում Parquet-ը։
Ինչպե՞ս եք լուծել օպտիմիզացիայի խնդիրները, երբ հարցումը երկար է տևում և իրականացնում է լրիվ սկան: Ինչպե՞ս մոտենաք նման նոր խնդիրներին։
Որ դեպքերում կարող է ClickHouse-ի Materialized View-ը բաց թողնել տվյալները կամ, հակառակը, կրկնօրինակել դրանք?
Դուք երբևէ հանդիպե՞լ եք ClickHouse `Too many parts` սխալի հետ մուտքագրելիս: Ինչպե՞ս եք լուծել այն։
Ի՞նչ Python գրադարանների հետ եք աշխատել:
Ավելացրեք ավելի մանրամասն տեղեկություններ շարդների միջև տվյալների խեղաթյուրումների մասին. ինչպես որոշվեց և ինչպես օգտագործվեց համապատասխան ֆունկցիան/մեխանիզմը։
Դուք ծանոթ եք ClickHouse-ում օգտագործողի սահմանած ֆունկցիաներին (UDF), արդյոք աշխատել եք դրանց հետ?
Ինչպե՞ս եք ուղղել տվյալների խեղաթյուրումը client_id-ի միջոցով, երբ մի հաճախորդ զգալիորեն մեծ էր մյուսների համեմատ: Ինչ տարբերակներ կան?
Ի՞նչ պարամետրերով եք ծանոթ Distributed շարժիչի մեջ ClickHouse-ում։
Ինչպե՞ս կվարվեիք Materialized View շղթայի հետ՝ միջնորդական ReplacingMergeTree աղյուսակի միջոցով՝ ճիշտ կերպով լրացնելու համար տվյալները, որոնք արդեն գոյություն ունեն նախքան նոր MV-ի գործարկումը։
Որ տարբերակով Airflow եք աշխատել?
Որ դաշտերում էր տվյալների միացումը և ինչպես հեռացվեցին կրկնօրինակները վիտրինայում?
Ինչպես կազմակերպել տվյալների բեռնումը ClickHouse-ում մեծ PostgreSQL աղյուսակում, որտեղ մշտապես գալիս են նոր գրառումներ մոնոտոնիկ աճող հիմնական բանալիով?
Դու գիտե՞ք ReplicatedQueue- ը: Արդյոք աշխատել եք նրա հետ: