Data Engineer
Колко общо работихте със Spark и колко дълбоко се потопихте в него?
С какви проблеми сте се сблъсквали при работа с Greenplum?
Какви са рисковете за качеството на данните?
Какво прави параметърът depends_on_past в Airflow?
Използва ли се методът за сравняване на хешове на записи за изчисляване на разликата между източника и целевата таблица?
Какво ще се случи, ако приложите `s ** 2` към списъка `s = [1, 2, 3]`?
Сравнете подходите ETL и ELT: каква е разликата и кога се прилагат всеки от тях?
С кои файлови формати работихте?
Какви видове партиции има?
Какво знаеш за spill в Spark?
Какви видове физически JOIN-ове съществуват в Spark?
Защо могат да се загубят данните? Дайте няколко причини.
Разкажете за себе си: опит, задачи, функции или постижения, с които се гордеете.
Имаш ли опит с FastAPI?
Как да организираме зареждането на данни в ClickHouse в голяма таблица PostgreSQL, в която постоянно постъпват нови записи с монотонно растящ първичен ключ?
С кои библиотеки на Python сте работили?
Какви са ленивите операции в Spark и за какво са необходими?
В коя ситуация търсенето в речник може да се влоши до най-лошия случай?
Каква е разликата между ACID и CAP теоремата?
Как работеха с 1C: взимаха данни директно от базата данни, чрез шината или по друг начин?