Data Engineer
Как да открием изкривяване на данните (data skew) в Spark?
Имали ли сте нужда да взаимодействате директно с Data Scientists, събирайки техните изисквания?
Сравнете подходите ETL и ELT: каква е разликата и кога се прилагат всеки от тях?
Какво ще върне функцията find_mode за списъка [1, 2, 3, 3, 4, 5]? Обяснете стъпка по стъпка.
Писали ли сте единични тестове? Имаш ли такъв опит?
Защо в момента разглеждате предложения за работа?
Имаме ORDER BY по брой поръчки, и има две поръчки с 5, още две с 3. Как ще се държат RANK() и DENSE_RANK()?
Имали ли сте опит в писането на документация?
Има ли функции и възможности в Greenplum, които не са в обикновения MySQL и други диалекти?
Какъв е твоят опит и разбиране в изграждането на пайплайни за изчисляване на витрини (обработка на данни)?
Създавате таблица audit_logs, където трябва да съхранявате датата и точното време с часови пояс. Кой тип данни е най-подходящ? час с часови пояс интервал timestamp с часови пояс дата timestamp без часови пояс
Разкажете за най-добрите практики при използването на индекси - кога и колко често да ги използвате.
Разкажи за нивото си на Python: какво си използвал, колко добре познаваш ООП
Как да намалим използването на паметта на DataFrame в Pandas?
Има такова понятие — нива на изолация на транзакциите. Какво знаеш за това?
Как може да се управлява shuffle в Spark (разделяне, broadcast join и т.н.)?
Какви инструменти за проследяване са използвали? В Spring Boot 2 и Spring Boot 3?
Използва ли се методът за сравняване на хешове на записи за изчисляване на разликата между източника и целевата таблица?
Опишете процеса на архивиране на данни от Oracle към Parquet (HDFS) по партиции и обратния pipeline за възстановяване на данни. Как да решите проблема с повторното архивиране на възстановените данни?
Как обикновено организирате работата си по задачите и как следите напредъка?