Data Engineer
Работили ли сте с инкрементални и пълни зареждания? Как се справяхте с дублиращите се записи?
Какво е статистика в контекста на системите за управление на бази данни и оптимизация на заявки?
Какво е партициониране на данни и как помага да се избегне пълното сканиране на таблицата?
Какво е shuffle в Spark и защо е важно да го минимизираме?
Имаш ли опит с Table Engine Join в ClickHouse?
Как Spark определя дали една таблица е достатъчно 'малка' за broadcast join (горна граница)?
Какво е Адаптивно изпълнение на заявки (AQE)?
Как да разделим заявката на етапи? Какво правим за това?
CREATE TABLE core.localUserMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = ReplikatsiyaReplacingMergeTree() ORDER BY (UserId); CREATE TABLE core.userMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = Distributed('cluster_4x2', 'core', 'localUserMetadata', cityHash64(LastLoginDate));
Как работи JOIN в ClickHouse?
Кои таблицени двигатели в ClickHouse знаете и сте използвали?
Какво беше последното ви решение на Python в продукция?
Ако съедините транзакции с клиенти по client_id и date_start (без BETWEEN), какво ще бъде уловено в резултата?
В кои случаи се прилага нормализация и в кои денормализация?
Разкажи ми, какво обичаш да правиш в свободното си време освен програмиране? Какви са хобитата ти?
Кой ресурс се използва най-много при Nested Loop Join?
На каква заплата очакваш?
Разкажете за използването на PL/SQL процедури във вашата работа.
По кои полета си разпределил данните в Greenplum?
Как да актуализирате таблица в ClickHouse така, че потребителите да не забележат нищо (атомарна замяна)?