Sobes.tech

Data Engineer

Спазва ли се ACID в Greenplum?

187

Какви процеси се стартират, когато изтриваме или променяме записи в ClickHouse?

187

Data Vault е удобен инструмент, но става много обекти. Можеш ли да обясниш разликата между хъбове, линкове и сателити?

187

Знаеш ли библиотека на Rust, многопоточна, много бърза, която може да замени Pandas за Data Science и Big Data?

184

Каква е разликата между CTE и подзаявка?

183

Как да разделим заявката на етапи? Какво правим за това?

182

Какви технологии използвахте за зареждане на данни в Parquet и какви механизми бяха използвани за получаване и зареждане на данните?

180

Зареждали ли сте данни от Spark в S3 във формат Parquet, а след това от Parquet в Greenplum — как протича процесът на зареждане?

177

Как бяха заредени данните от външната таблица в целевите таблици?

175

Как написа DAG и задачите в Airflow — ръчно или с шаблони?

175

Работили ли сте с Git? Какво съхранявахте в Git?

174

С поточно предаване работеше Iceberg, чу ли? Това е боклук хранилище за файлове.

173

Как обикновено проектираш схемата на базата данни — правиш го ръчно в базата, или съхраняваш скриптовете някъде, или изобщо използваш Liquibase? Какъв беше процесът?

173

С зависимости между работи, между DAG — използвахте сензори, за да се стартират няколко работи една след друга?

171

Това е в реално време, как да го реализираме между Kafka и ClickHouse Spark?

170

Има ли смисъл да използвате CTE, ако се използва само веднъж в заявката?

169

Ще парсираме JSON — кой ще парсира JSON? Колкото знам, в ClickHouse няма функции.

166

Работили ли сте директно със Spark? Какъв е неговият минус?

165

Iceberg е двигател, който позволява да превърнете S3 в база данни, той дори спазва ACID. Какъв е неговият минус?

161

Имаме нужда от pipeline engine — механизъм, който ще позволи много бързо създаване на потоци чрез подаване на договори и параметри. Как бихте реализирали това на по-високо ниво?

161
/3