Data Engineer
Как да открием изкривяване на данните (data skew) в Spark?
Кои таблицени двигатели в ClickHouse знаете и сте използвали?
Проверките на качеството на данните ги правехте сами или изискванията идваха от бизнеса/клиентите?
Работили ли сте някога с оптимизатора AQE (Адаптивно изпълнение на заявки) в Spark? Знаете ли как работи?
Разкажи за някои от най-важните си задачи, свързани с качеството на данните.
Разкажете за опита си с миграцията от Spring Boot 2 към Spring Boot 3
Какво се случва в PostgreSQL след изпълнение на заявка SELECT * FROM [таблица]?
Джобове от dbt в Airflow — писахте ги ръчно или автоматизирахте по някакъв начин, имаше ли шаблони?
Какви процеси се стартират, когато изтриваме или променяме записи в ClickHouse?
Как влияе ORDER BY върху таблицата ClickHouse и кои ключове е по-добре да изберете?
Посочете пет команди Git.
Каква е разликата между EXPLAIN ANALYZE и обикновен EXPLAIN? Защо не е препоръчително да го изпълнявате на DELETE/UPDATE заявки?
В кои случаи се прилага нормализация и в кои денормализация?
Каква е разликата между командите docker run и docker exec?
Разкажете за използването на PL/SQL процедури във вашата работа.
Какво е план за заявки? За какво са нужни?
Каква е опасността от shuffle в Spark?
Правихте ли допълнително логване освен логовете на Airflow?
Какви видове ключове/стратегии за разпределение съществуват в Greenplum?
По кои полета си разпределил данните в Greenplum?