Data Engineer
Имали ли сте опит с оптимизация на SQL заявки? Дайте пример.
В тази схема Trino отговаря за обработката на данните — как стекът от технологии позволява разделянето на съхранението и изчисленията?
Кои групи SQL оператори знаете? Към какво се отнасят?
Каква е опасността от shuffle в Spark?
Какво е партициониране на данни и как помага да се избегне пълното сканиране на таблицата?
Коя стратегия ще бъде ефективна за премахване на уязвимостта във всички клонове с минимски риск от нарушаване на работата на проекта? - Създаване на серия от revert комити за проблемния комит и всички комити, които го частично са поправили, след което създаване на нов комит с пълното поправяне - Създаване на hotfix клон от точка преди проблемния комит, извършване на поправки и сливане на този клон с всички засегнати клонове - Създаване на единен поправителен комит с помощта на git revert abc123 в основния клон и след това cherry-pick на този комит във всички релийз клонове - Използване на git bisect за точно определяне на проблемния код, създаване на пач и прилагането му към всички клонове с git am - Използване на git rebase -i за редактиране на проблемния комит във всеки клон, последвано от force-push (force-push)
Имал ли си опит с Docker образи, настройване на среда на виртуална машина?
Складът беше построен по схемата Data Vault — ти също го развиваше, поддържаше ли? Ръчно добавяше хъбове, линкове?
Разкажи за индексите в Greenplum и ClickHouse
В кои случаи Materialized View в ClickHouse може да пропусне данни или, напротив, да ги дублира?
Какво не ти харесва в момента в работата ти?
Какво е важно за теб в нов проект, нов екип или компания?
Как да премахнете подмодул и свързаните с него файлове от проекта? git submodule remove <път-до-подмодул> git rm --cached <път-до-подмодул>; премахнете секцията от .gitmodules; git commit git clean --submodules <път> git submodule delete <път> git remove submodule <път>
Имаше бавен аналитичен заявка в Hive. Как да разберем какво се случи с нея и как да я поправим?
Анализ на dbt модел с инкрементална стратегия: какво прави моделът, има ли проблеми?
Какво е CROSS JOIN? Работили ли сте с такъв?
Каква е разликата между == и is в Python?
Какво е проследимост? Имали ли сте опит с нея?
Какви видове JOIN има в SQL (логически и физически)?
Кое из изразите на мястото [...] автоматично ще доведе до създаване на индекс? На мобилната платформа има хоризонтално превъртане на кода create table some_table( col_name [...] ); unique references other_table(col_name) not null serial integer check (col_name > 0)