Data Engineer
С кои бази данни сте работили? Как работи MongoDB и как се мащабира?
Как определихте, че записът вече съществува и не е необходимо да го записвате отново?
NULL плюс 5 — колко ще бъде?
Може ли да се чете паралелно данни от един Parquet файл в Spark, или само с едно ядро в една задача?
Какво е RDD в Apache Spark и как се различава от другите абстракции на Spark?
Правил ли си статистически проверки?
Може ли да се създаде и приложи декоратор без синтаксиса @?
Ако графикът на DAG е @daily, в колко часа всъщност се стартира?
Какво са декораторите в Python?
За какво са нужни "папки"/префикси в S3 освен за удобство?
Как технически беше реализирано паралелното изтегляне на голяма таблица от PostgreSQL към Spark в случая [контекст]?
Как да реализираме неравномерното разпределение на данните във витрината: 50% на първата и по 25% на останалите две?
Как да се борим с несъответствията в данните?
Как бяха създадени таблиците в клъстера и как решихте проблема, когато поради ZooKeeper липсваше реплика на шард?
Как следяхте качеството на данните?
От кои етапи се състои транзакцията?
Защо решихте да изнесете рангирането в отделна CTE? Защо не можеше да се използва директно в първата CTE?
Как да работите с партиции чрез coalesce и repartition?
Как правилно да отваряме и затваряме файлове в Python с помощта на контекстен мениджър?
Познат ли ви е ReplicatedQueue? Имали ли сте опит с нея?