Какви са индексите в базите данни, за какво служат и каква е тяхната вътрешна структура?
Data Engineer
Разкажи за своя опит на последните работни места, какви проекти, какъв стек?
Каква е разликата между UNION и UNION ALL? Какви условия трябва да бъдат изпълнени?
Кои групи SQL оператори знаете? Към какво се отнасят?
Какво е Catalyst оптимизатор в Spark и какви конкретни оптимизации извършва (например, predicate pushdown)?
Как работи Hash Join?
Какво е нормализация? В коя форма работим основно?
Как проверявате точността на данните при превод на pipeline от SAS към DBT?
Защо възникват deadlock-и и кой механизъм в базите данни отговаря за консистентността на данните при паралелни заявки?
Защо избрахте точно DBT? Какви предимства и недостатъци виждате в този фреймуърк?
Проверки за качество на данните — на какъв етап, какви проверки, какво се случва с невалидните данни?
Работили ли сте с инциденти на качеството на данните?
Какви са характеристиките и разликите между Set и List в Python? Освен производителността, какви други характеристики има?
Разкажете за интересна задача във фирмата през последните 2,5 години, например свързана с ClickHouse.
Как работи Merge Join (съединяване с сортиране)?
Какви формати за разпределение има в Greenplum освен BY column и RANDOMLY?
Избройте последователността на изпълнение на операциите в SQL заявка с SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT от първата до последната.
Предпочиташ ли да работиш като експерт индивидуално или в екип от разработчици?
Какви видове физическо свързване на таблици съществуват (Hash Join, Merge Join, Nested Loop)?
Ако съедините транзакции с клиенти по client_id и date_start (без BETWEEN), какво ще бъде уловено в резултата?