Data Engineer
Работили ли сте с feature store-ове?
Какво знаеш за spill в Spark?
Представете си, че Data Vault не е наличен и има две широки таблици, които трябва да се свържат. Как бихте оптимизирали това в Greenplum? А ако беше в ClickHouse?
Как бих реализирал филтриране преди join в самия заявка?
От Москва ли си? От колко време живееш тук? Защо се премести в Москва?
Как физически протича механизмът broadcast — как достигат партициите на малка таблица до изпълнителите с голяма таблица?
Защо използвахме Parquet вместо ORC?
Как ще се решава работата с рисковете от разминаване на данните и отговорността за данните?
Как работихте с файловете при повторното стартиране на DAG след неговия срив, за да не презапишете данните в S3 с непълни данни?
Топ 3 критерия за избор на оферта, ако има няколко предложения.
Какво е "мъртва кортежа" (dead tuple)?
Какво е Spark JDBC и как ефективно да заредите голяма таблица чрез него?
Функцията за прозорец SUM() OVER (PARTITION BY user_id) — в един случай добавяме ORDER BY дата на покупка, в друг не. Каква е разликата?
Как са устроени вашите dbt модели и как събирате витрината от няколко източника чрез Trino?
Какво е идеалното съотношение между бизнес задачите и инфраструктурните задачи за вас?
Какъв тип съхранение има Parquet: ред или колона?
Разкажете за задачата с настройката на репликацията, която решихте.
Какво ще се случи, ако приложите `s ** 2` към списъка `s = [1, 2, 3]`?
Има ли други механизми за управление на shuffle освен coalesce/repartition?
Какво те привлича в областта на пътуванията? Може би сам обичаш да пътуваш, или travel-tech те заинтересува по някакъв начин?