Data Engineer
Каква е разликата между RANK и DENSE_RANK?
Какво е семантично версиониране? Кога да увеличаваме major, minor, patch?
Кои групи SQL оператори знаете? Към какво се отнасят?
LEFT JOIN: таблица с 10 записи LEFT JOIN таблица с 100 записа. Какво е минималното и максималното количество редове, които могат да се получат?
Работили ли сте с инкрементални и пълни зареждания? Как се справяхте с дублиращите се записи?
Какво е shuffle в Spark и защо е важно да го минимизираме?
Имали ли сте опит в оптимизацията на Spark задачи? Можете ли да дадете конкретен пример?
Джобове от dbt в Airflow — писахте ги ръчно или автоматизирахте по някакъв начин, имаше ли шаблони?
Запознат ли си с OLAP кубове? Когато работим с многомерни данни, подобни на сводна таблица в Excel, но за по-бързо взаимодействие с големи обеми данни.
Разкажи повече за мрежата: какво е и защо е важна?
CREATE TABLE core.localUserMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = ReplikatsiyaReplacingMergeTree() ORDER BY (UserId); CREATE TABLE core.userMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = Distributed('cluster_4x2', 'core', 'localUserMetadata', cityHash64(LastLoginDate));
Как работи JOIN в ClickHouse?
Кои таблицени двигатели в ClickHouse знаете и сте използвали?
Как да избегнете/отстраните изкривяването на данните в Spark?
Имали ли сте нужда да взаимодействате директно с Data Scientists, събирайки техните изисквания?
Как Spark определя дали една таблица е достатъчно 'малка' за broadcast join (горна граница)?
Имали ли сте някога нужда да пишете пакети в Oracle?
Разкажи ми, какво обичаш да правиш в свободното си време освен програмиране? Какви са хобитата ти?
Кой ресурс се използва най-много при Nested Loop Join?
Запозна ли сте с общи таблицени изрази (CTE)? Дайте пример за използване.