Какво можеш да разкажеш за SOAP API?
Data Engineer
Как стартирахте DAG-овете: по cron, датасети, тригери или зависимости?
Какви проверки за качество на данните бяха извършени в Data Vault?
Как се свързаха с OpenMetadata и какво направиха с нея?
Как да проследите в кое изпълнение на DAG се появи конкретен ред в Data Vault?
Дайте пример за типична задача за писане на DAG в Airflow.
Управлявали ли сте Airflow или сте работили само като разработчик?
Как оптимизираха таблиците и заявките: партиции, индекси, логика на избор?
Разкажи за себе си: с какво се занимаваше, какъв стек използва и какъв беше проектът?
Може ли да се използва случайно разпределение в Greenplum и кога е подходящо?
Какви SQL заявки пишеш: прости проверки или сложни скриптове за витрини?
Правихте ли допълнително логване освен логовете на Airflow?
Кога можеш да дадеш обратна връзка и имаш ли оферти на ръка?
Използвали ли сте Bridge и PIT таблици в Data Vault? Дайте пример и обяснете предназначението.
Какви допълнителни същности на Data Vault, освен hub, link и satellite, са използвани: например, same-as links или transactional links?
S3 беше единственото основно хранилище или използвахте няколко?
Избройте известните ви SQL функции за прозорец.
Използвахте един S3 bucket или няколко? По какъв принцип?
Изградихте ли линията от източника до потребителя?
Какъв тип съхранение има Parquet: ред или колона?