ClickHouse-те DDL/CREATE TABLE-дің қандай қосымша параметрлерін білесіз, олар неге әсер етеді және қай жағдайда пайдаланылады?
Data Engineer
Дүкен деректерін үш шарда бөлу керек: бірінші шардта 50%, қалған екеуінде 25% әрқайсысы. Бұл қалай жүзеге асырылады?
Кластерде кестелер қалай жасалды және ZooKeeper-дің әсерінен бір шардтағы реплика жоқ болған мәселесін қалай шешті?
Қалайша сіз ұзақ жұмыс істейтін және толық скан жүргізетін сұраулар кезінде оңтайландыру мәселелерін шештіңіз? Мұндай жаңа тапсырмаға қалай қарайсыз?
Parquet-ті нақты қалай оқыдыңыз?
ClickHouse-те Materialized View деректерді жіберіп алуы немесе қайталануы мүмкін жағдайлар қандай?
ClickHouse-тың 'Too many parts' қатесімен енгізу кезінде кездестіңіз бе? Оны қалай шештіңіз?
Қандай Python кітапханаларымен жұмыс істедіңіз?
Шардтар арасындағы деректердің бұрмалануын толығырақ айтыңыз: оны қалай анықтадыңыз және сәйкес функция/механизмді қалай қолдандыңыз?
Сіз ClickHouse-те UDF (Пайдаланушы анықтаған функциялар) туралы білесіз бе, олармен жұмыс істедіңіз бе?
Бір клиент басқа клиенттерге қарағанда айтарлықтай үлкен болған кезде, client_id бойынша деректердің бұрмалануын қалай түзеттіңіз? Қандай нұсқалар бар?
ClickHouse-тың Distributed қозғалтқышының қандай параметрлерімен таныссыз?
Жаңа MV іске қосылмай тұрып, бұрыннан бар деректерді дұрыс толтыру үшін материалданған көрініс тізбегін аралық ReplacingMergeTree кестесі арқылы қалай өңдер едіңіз?
Қандай версиядағы Airflow-мен жұмыс істедіңіз?
Деректер біріктіру қай салаларда болды және көріністе қайталанулар қалай жойылды?
Үнемі өсіп келе жатқан негізгі кілті бар үлкен PostgreSQL кестесі бар. Деректерді ClickHouse-қа қалай жүктеуді ұйымдастыру керек?
Сіз ReplicatedQueue-мен таныссыз ба? Онымен жұмыс істедіңіз бе?