Разкажете за задачата с настройката на репликацията, която решихте.
Data Engineer
В кои случаи се прилага нормализация и в кои денормализация?
Как да избегнете/отстраните изкривяването на данните в Spark?
Кой е алгоритъмът за диагностика и какво да правите, ако заявката все още е бавна след добавяне на няколко индекса?
Какво е нормализация и ER модел, за какво са необходими?
Разкажете за основните концепции на Kafka (група потребители, раздели, теми).
Какви са типичните причини за това, че заявката в релационна база данни работи бавно?
Какви неочевидни проблеми могат да възникнат при зареждане на големи таблици (освен производителността)?
Предложете решение за редовно инкрементално зареждане на голяма таблица с гъвкава (променяема) честота на актуализация от Postgres към Data Lake.
Как са свързани сортирането вътре във функцията на прозореца и крайната сортиране ORDER BY в заявката?
Как да управляваме ресурсите на Spark приложението, за да не изразходваме прекалено памет при промяна на обема на входните данни?
Как да работите с партиции чрез coalesce и repartition?
Какви Docker образи трябваше да изградите и защо?
Има ли други механизми за управление на shuffle освен coalesce/repartition?
Кои параметри на Spark JDBC бяха използвани за паралелно четене?