ClickHouse'da DDL/CREATE TABLE ile ilgili hangi ek parametreleri biliyorsunuz, bunlar nelere etkiler ve hangi durumlarda kullanılırlar?
Data Engineer
Verileri üç şarta eşit olmayan şekilde dağıtmak için nasıl uygulayabilirsiniz: ilk şarta %50 ve diğer ikisine %25?
Küme içinde tablolar nasıl oluşturuldu ve ZooKeeper nedeniyle bir shard'da replik eksik olduğunda sorunu nasıl çözdünüz?
Sorgulama uzun sürdüğünde ve tam tarama yaptığında optimizasyon sorunlarını nasıl çözdünüz? Yeni böyle bir göreve nasıl yaklaşırdınız?
Parquet'i tam olarak nasıl okudunuz?
ClickHouse'da Materialized View hangi durumlarda verileri atlayabilir veya tam tersi, onları çoğaltabilir?
Ekleme sırasında ClickHouse `Too many parts` hatasıyla karşılaştınız mı? Nasıl çözdünüz?
Hangi Python kütüphaneleriyle çalıştınız?
Shardlar arasındaki veri kaymasının detaylarını anlatın: nasıl belirlendi ve ilgili fonksiyon/mekanizma nasıl kullanıldı?
ClickHouse'da UDF (Kullanıcı Tanımlı Fonksiyonlar) ile tanışıyor musunuz, onlarla çalıştınız mı?
Bir müşterinin diğerlerinden önemli ölçüde büyük olduğu durumda client_id verilerindeki önyargıyı nasıl düzelttiniz? Hangi seçenekler var?
ClickHouse'daki Distributed motorunun hangi parametreleriyle tanışıyorsunuz?
Yeni MV'yi başlatmadan önce zaten var olan verileri doğru şekilde doldurmak için, ara ReplacingMergeTree tablosu üzerinden Materialized View zinciri ile nasıl ilerlerdiniz?
Veri birleştirme hangi alanlarda gerçekleşti ve vitrinlerde nasıl çoğaltmalar kaldırıldı?
Hangi Airflow sürümünü kullandınız?
Monoton şekilde artan bir birincil anahtarla sürekli yeni kayıtlar gelen büyük PostgreSQL tablosunda ClickHouse'a veri yükleme nasıl organize edilir?
ReplicatedQueue ile tanışıyor musunuz? Onunla çalışma deneyiminiz var mı?