Разкажи за релационните бази данни като цяло — какво представляват?
Data Engineer
Какво е ACID? Какво означава всяка буква? Как това се отнася до транзакциите?
Знаеш ли формата Avro?
Кога не ни трябва хранилище за данни?
Споменахте процесите Docker, можете ли да разкажете повече за това как е организирано при вас?
Какво е утиная типизация (duck typing)?
Имал ли си опит с Docker образи, настройване на среда на виртуална машина?
Какви са ограниченията при използването на хеш таблици?
Как е организирано вашето QA (проверка на качеството на данните)?
Каква е разликата между рефакторинг и оптимизация?
Какво е план за заявки? За какво са нужни?
Какви са видовете физически връзки (методи за свързване)?
Имаш ли опит с Table Engine Join в ClickHouse?
Разкажете ли ми за вашия опит с разпределени бази данни (Greenplum, ClickHouse)?
Представете си, че Data Vault не е наличен и има две широки таблици, които трябва да се свържат. Как бихте оптимизирали това в Greenplum? А ако беше в ClickHouse?
Какво не ти харесва в момента в работата ти?
Имате ли опит с двигатели като Trino или с таблицени формати (Iceberg, Parquet) в Spark?
Може ли да се измисли нещо друго вместо обикновен CTE, като се има предвид, че филтрирането все още се извършва в паметта върху цялата таблица?
За какво изобщо ви беше нужен Data Vault?
В каква среда беше стартиран Spark?