Data Engineer
Къде можете да видите логовете на задачите в Airflow?
Дадени са две таблици t1 и t2. Задачата е да изброите всички видове джойн, които знаете, и резултата от заявката select * from t1 <join> t2 on t1.t = t2.t за всеки от тях. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null
Къде работи по-добре компресирането на данни — в колоново или редово съхранение и защо?
Какви са индексите в базите данни, за какво служат и каква е тяхната вътрешна структура?
SELECT * FROM table1 AS t1 LEFT JOIN table2 AS t2 ON t1.date_start > t2.date_start
ИЗБЕРЕТЕ * ОТ таблица1 като t1 ЛЯВО JOIN таблица2 като t2 ON t1.date_start > t2.date_start d = { True: 42, 1: 2, 1.0: 100500 } print(d)
Разкажете ни за опита си с Greenplum, DBT и Data Vault. Защо преминахте от модела снежинка към Data Vault?
CREATE TABLE orders ( driver_id varchar, city varchar, order_id varchar ); -- Вземете топ 10 шофьори по брой поръчки във всеки град
Как да подходите към ситуацията, когато бизнесът иска доклад с визуализация на данни за нова акция?
Анализ на посещаемостта на фитнес клубов Вие работите като анализатор в мрежа от фитнес клубове. Имаме информация за посещенията на потребителите и за закупените от тях абонаменти. Необходимо е да анализирате ефективността на използването на абонаментите. Изчислете за всеки тип абонамент: • общия брой потребители, използвали този тип абонамент. Вземете предвид само уникалните user_id; • общия брой посещения за този абонамент. Вземете предвид всички посещения на потребителите с този абонамент; • делът на потребителите с този абонамент в проценти от общия брой потребители (закръглен до една десета). За изчисление използвайте отношението между броя на потребителите с този абонамент и общия брой на уникалните потребители. Всеки потребител може да има само един абонамент. Резултатът сортирайте по тип на абонамента в азбучен ред. Формат на входа Таблица memberships: • membership_id (int) — уникален идентификатор на абонамента • user_id (int) — уникален идентификатор на потребителя • membership_type (text) — тип на абонамента Таблица visits: • visit_id (int) — уникален идентификатор на посещението • user_id (int) — идентификатор на потребителя • visit_date (timestamp) — дата и час на посещението Данните не съдържат пропуски или некоректни стойности. Формат на изхода Заявката трябва да върне таблица с полетата в следния ред: • membership_type (text) — тип на абонамента • users_count (int) — брой уникални потребители с този тип абонамент • total_visits (int) — общ брой посещения на тези потребители • user_share (numeric) — делът на потребителите с този тип абонамент в проценти от общия брой, закръглен до една десета Резултатът трябва да бъде сортиран по тип на абонамента в азбучен ред.
Къде се появява паралелизмът в Airflow?
Разкажи какво знаеш за колонно и редово съхранение на данни. Кога и кое трябва да избереш и защо?
Threading, multiprocessing, asyncio: каква е разликата и кога е по-добре да използвате кое?
Каква е разликата между RANK() и DENSE_RANK()?
Разкажи ми за своя опит в работата: задачи, стек от технологии
Как обработва Pandas липсващите данни?
Колко допълнителна памет изисква решение със речник, без да се броят върнатите данни?
Защо Pandas е по-добър от обикновените списъци и речници в Python?
Каква е разликата между цикъл върху низ и цикъл върху tuple в Python? Какви типове са основни и как това влияе на производителността?
Как работехте с Impala?