ClickHouse-те жазбаларды жою немесе өзгерткенде қандай процестер іске қосылады?
Data Engineer
Data Vault — ыңғайлы нәрсе, бірақ объектілер көп болып кетеді. Хабтар, линктер және сателлиттер арасындағы айырмашылықты түсіндіре аласыз ба?
Ақырында мұнда не болатынын айтып бере аласыз ба? Әр қадамды түсіндіріп, қалай жұмыс істейтінін айтыңыз.
Сізде Data Science және үлкен деректерді өңдеу тәжірибесі бар — Rust тілінде жазылған, көп ағынды, Pandas-қа қарағанда өте жылдам кітапхана бар. Мұндай кітапханалар туралы білесіз бе?
CTE мен подзапрос арасындағы айырмашылық қандай?
Сұрауды кезеңдерге қалай бөлуге болады? Ол үшін не істейміз?
Parquet, сіз деректерді жүктедіңіз — деректерді қабылдау және жүктеу үшін қандай технологиялар қолданылды және қандай механизмдер пайдаланылды?
Сіз Spark-тан S3-ке Parquet форматында деректер жүктедіңіз, содан кейін Parquet-тен Greenplum-қа — жүктеу процесі қалай өтеді?
Airflow DAG-тарын және жұмыстарын қолмен жаздыңыз ба, әлде шаблондар арқылы ма?
Шетелдік кестеден деректер қалай мақсатты кестелерге жүктелді?
Streaming-пен жұмыс істейтін Iceberg-ті естідіңіз бе? Бұл файл сақтау орны — қоқыс.
Git-пен жұмыс істедіңіз бе? Git-те не сақтадыңыз?
Жұмыстар мен DAG-тар арасындағы тәуелділіктермен — бірнеше жұмысты бірінен соң бірін іске қосу үшін сенсорларды қолдандыңыз ба?
Дерекқор схемасын әдетте қалай жасайтын едің — тікелей дерекқорда қолмен бе, әлде сценарийлерді қайда сақтайтын едің, немесе мүлде Liquibase-те отырдың ба, қандай процесс болды?
Бұл нақты уақыт режимі, Kafka мен ClickHouse Spark арасында қалай қосылуды жүзеге асыру керек?
Егер CTE сұрауда бір рет қолданылса, оны қолданудың мағынасы бар ма?
JSON-ды біз парсимыз — JSON-ды кім парсит? ClickHouse-те функция жоқ, менің білуімше.
Spark-пен тікелей жұмыс істедіңіз бе? Оның кемшілігі неде?
Бізге pipeline engine керек — бұл механизм, ол арқылы келісімшарттар мен параметрлерді енгізу арқылы ағындарды өте тез құруға болады. Сен оны жоғарғы деңгейде қалай жүзеге асырар едің?
Greenplum қандай оқу түрін пайдаланады — жолдық немесе бағандық?