Data Engineer
Какъв опит имате с SQL и релационните бази данни?
Как е организирано вашето QA (проверка на качеството на данните)?
Какво ще се случи, ако приложите `s ** 2` към списъка `s = [1, 2, 3]`?
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Разкажи ми за процесите CI/CD, промените в базата данни, версионирането и миграциите на схемата (еволюция на схемата).
Какви методи за пренос на данни между задачите в Airflow познавате?
А ако ни трябват всички клиенти, дори и да нямат транзакции в тази дата, как да ги покажем?
Какви са плановете ти за следващите 5 години? В кои области искаш да се развиваш?
Използвате ли изкуствен интелект в текущата си работа? Какви инструменти и как точно?
Работили ли сте с пакетно зареждане или стрийминг?
Какво е CDC и имате ли опит с него?
Има такова понятие — нива на изолация на транзакциите. Какво знаеш за това?
С какви инструменти за визуализация сте работили и колко тясно сте работили с Power BI?
Работили ли сте с контекстни мениджъри в Python? Какво представляват и за какво служат?
Какво знаеш за сериализацията и десериализацията в контекста на Spark/UDF?
Разкажи ми за разбирането ти за качеството на данните — имал ли си опит с тази област?
Разкажи за текущото си работно място: основен продукт, твоята функция.
Какви въпроси имаш към мен?
импортирайте clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Разкажете за задачата с настройката на репликацията, която решихте.