Какво е тригерът за създаване на нов Job в Spark и как се дели Job-ът на Stages и Tasks?
Data Engineer
Обяснете на високо ниво как е структурирана архитектурата на Spark: кои компоненти съществуват и как взаимодействат при изпълнение на SQL заявка.
Какво е партициониране? Какво е шардване? Какво е репликация?
Ако поставим условие за филтриране по дата на транзакцията в WHERE (след LEFT JOIN), ще ограничи ли това резултата по първата таблица (клиенти)?
## въпрос за модата # Има списък с числа. Напишете функция, която намира модата на този списък. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [телефон] null null 5 ИЗБЕРИ a.num КАТО a_num, b.num КАТО b_num ОТ t1 a ЛЯВО JOIN t2 b ON a.num = b.num;
За какво отговаря Групата на редовете в структурата на Parquet файла?
Какво ще върне функцията find_mode за списъка [1, 2, 3, 3, 4, 5]? Обяснете стъпка по стъпка.
Разкажи ми къде си работил като системен анализатор и какви задачи си изпълнявал?
Каква е разликата между формата за съхранение Parquet и CSV?
Каква е разликата между партициониране и шардване?
Проверките на качеството на данните ги правехте сами или изискванията идваха от бизнеса/клиентите?
Какви методи (типове) за съхранение на историята на данните познавате? Как се натрупва историята в таблиците?
Кой формат на работа е по-удобен за вас — офис, хибрид или дистанционна работа? Имаме два офиса, на Кутузовски и на Тула.
Какви видове физически JOIN-ове съществуват в Spark?
Как да изведете последното пълно име за всеки клиент, ако е известна само началната дата (крайната дата не е известна)?
Кой физически механизъм за JOIN ще бъде използван при съединяване на таблицата с транзакции с таблицата с календар по условие за неравенство (дата <= дата)?
Какво означава UNBOUNDED PRECEDING в границите на прозоречната функция?
Работили ли сте някога с оптимизатора AQE (Адаптивно изпълнение на заявки) в Spark? Знаете ли как работи?