Спазва ли се ACID в Greenplum?
Data Engineer
Какви процеси се стартират, когато изтриваме или променяме записи в ClickHouse?
Data Vault е удобен инструмент, но става много обекти. Можеш ли да обясниш разликата между хъбове, линкове и сателити?
Знаеш ли библиотека на Rust, многопоточна, много бърза, която може да замени Pandas за Data Science и Big Data?
Каква е разликата между CTE и подзаявка?
Как да разделим заявката на етапи? Какво правим за това?
Какви технологии използвахте за зареждане на данни в Parquet и какви механизми бяха използвани за получаване и зареждане на данните?
Зареждали ли сте данни от Spark в S3 във формат Parquet, а след това от Parquet в Greenplum — как протича процесът на зареждане?
Как бяха заредени данните от външната таблица в целевите таблици?
Как написа DAG и задачите в Airflow — ръчно или с шаблони?
Работили ли сте с Git? Какво съхранявахте в Git?
С поточно предаване работеше Iceberg, чу ли? Това е боклук хранилище за файлове.
Как обикновено проектираш схемата на базата данни — правиш го ръчно в базата, или съхраняваш скриптовете някъде, или изобщо използваш Liquibase? Какъв беше процесът?
С зависимости между работи, между DAG — използвахте сензори, за да се стартират няколко работи една след друга?
Това е в реално време, как да го реализираме между Kafka и ClickHouse Spark?
Има ли смисъл да използвате CTE, ако се използва само веднъж в заявката?
Ще парсираме JSON — кой ще парсира JSON? Колкото знам, в ClickHouse няма функции.
Работили ли сте директно със Spark? Какъв е неговият минус?
Iceberg е двигател, който позволява да превърнете S3 в база данни, той дори спазва ACID. Какъв е неговият минус?
Имаме нужда от pipeline engine — механизъм, който ще позволи много бързо създаване на потоци чрез подаване на договори и параметри. Как бихте реализирали това на по-високо ниво?