Data Engineer
Какъв е твоят опит и разбиране в изграждането на пайплайни за изчисляване на витрини (обработка на данни)?
Ако поставим условие за филтриране по дата на транзакцията в WHERE (след LEFT JOIN), ще ограничи ли това резултата по първата таблица (клиенти)?
Имали ли сте опит с настройка на pipeline в CI/CD, например GitLab?
Каква е разликата между WHERE и HAVING в SQL?
Създавате таблица audit_logs, където трябва да съхранявате датата и точното време с часови пояс. Кой тип данни е най-подходящ? час с часови пояс интервал timestamp с часови пояс дата timestamp без часови пояс
Разкажете за най-добрите практики при използването на индекси - кога и колко често да ги използвате.
С поточно предаване работеше Iceberg, чу ли? Това е боклук хранилище за файлове.
Разкажете за използването на PL/SQL процедури във вашата работа.
Какви са характеристиките и разликите между Set и List в Python? Освен производителността, какви други характеристики има?
Как да открием изкривяване на данните (data skew) в Spark?
Имали ли сте опит в оптимизацията на Spark задачи? Можете ли да дадете конкретен пример?
Как разбираш концепцията за ключове в таблиците — за какво е това?
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Как обикновено организирате работата си по задачите и как следите напредъка?
В какъв ред се извършват основните операции в SQL: SELECT, FROM и т.н.?
Има ли функции и възможности в Greenplum, които не са в обикновения MySQL и други диалекти?
Какви видове партиции има?
Какви са предимствата и недостатъците на разпределените системи за бази данни?
Дайте пример кога сте успели да подобрите процесите или инструментите за екипа.
Кои бяха потребителите на данни и как се изграждаха витрините?