ClickHouse'da DDL/CREATE TABLE ning qaysi qo'shimcha parametrlari bilan tanishsiz, ular nima uchun ta'sir qiladi va qaysi hollarda ishlatiladi?
Data Engineer
Klasterda jadvallar qanday yaratilgan va ZooKeeper sababli bir shardda replika bo'lmaganda muammo qanday hal qilingan?
Ushbu vitrinadagi ma'lumotlarni uchta shardga notekis taqsimlash: birinchisida 50% va ikkinchisida 25% har biri?
Parquetni qanday o'qiganingizni aniq ayting.
So'rov uzoq davom etganda va to'liq skanerlash amalga oshirilganda optimallashtirish muammolarini qanday hal qildingiz? Yangi shunday vazifaga qanday yondashardingiz?
ClickHouse'da Materialized View qachon ma'lumotlarni o'tkazib yuborishi yoki aksincha, ularni takrorlashi mumkin?
ClickHouse `Too many parts` xatosi bilan qanday muomala qildingiz? Uni qanday hal qildingiz?
Qaysi Python kutubxonalar bilan ishladingiz?
Shardlar orasidagi ma'lumotlar qiyosati haqida batafsilroq aytib bering: uni qanday aniqlashdi va mos keladigan funktsiya/mekanizmni qanday ishlatishdi?
Siz ClickHouse'da UDF (Foydalanuvchi tomonidan belgilangan funktsiyalar) bilan tanishmisiz, ular bilan ishladizmi?
Client_id bo'yicha ma'lumotlar yomonlashuvi qanday tuzatildi, agar bir mijoz boshqalardan ancha katta bo'lsa? Qanday variantlar mavjud?
ClickHouse'dagi Distributed dvigatelining qaysi parametrlar bilan tanishsiz?
Yangi MVni ishga tushirishdan oldin mavjud bo'lgan ma'lumotlarni to'g'ri to'ldirish uchun, oraliq ReplacingMergeTree jadvali orqali Materialized View zanjirini qanday boshqarardingiz?
Qaysi Airflow versiyasida ishladingiz?
Ma'lumotlarni birlashtirish qaysi maydonlarda bo'ldi va ko'chirmalarni qanday olib tashladilar?
Monoton ravishda o'sib borayotgan birlamchi kalit bilan doimiy ravishda yangi yozuvlar keladigan katta PostgreSQL jadvalida ClickHouse ga ma'lumotlarni qanday yuklashni tashkil qilish mumkin?
Siz ReplicatedQueue bilan tanishdingizmi? U bilan ishlash tajribangiz bormi?