Как запускали DAG-и: по cron, датасетам, триггерам или зависимостям?
Data Engineer
А с инцидентами качества данных работали?
В Greenplum какие существуют виды ключей/стратегий дистрибуции?
Что такое YARN и зачем он нужен?
Какие группы операторов SQL знаешь? Что к ним относится?
Как парсить большие XML-файлы в ZIP и загружать в ClickHouse на Python?
Что такое партиционирование данных и как оно помогает избежать полного сканирования таблицы?
Как работает MapReduce, в частности стадия Reduce?
Как работали с CI/CD?
В чём разница между EXPLAIN и EXPLAIN ANALYZE?
Тебе пришла задача с номером ABC. Каков твой порядок действий в Git при начале работы?
Когда выгоднее использовать hash partition, а когда range partition?
Можешь рассказать, что здесь в итоге у нас получится? Нужно прокомментировать каждый шаг, как это работает.
Знакомы ли с CTE (common table expressions)? Приведите пример использования.
SELECT * FROM table1 AS t1 LEFT JOIN table2 AS t2 ON t1.date_start > t2.date_start --DML CREATE TABLE IF NOT EXISTS Employee (id int, salary int, departmentId int); INSERT INTO Employee (id,salary,departmentId) VALUES (1, 70000, 1),(2, 94000, 1),(3, 85000, 1),(4, 80000, 2),(5, 60000, 2),(6, 62000, 3),(7, 90000, 3),(8, 94000, 3),(9, 94000, 3); with cte as( select *, rank() over(partition by departmentId order by salary desc) as max_salary from Employee ) select * from cte where max_salary = 1","targetLocales":["ru","kk"]},{
Объясните, как технически работает Git LFS и какие преимущества он предоставляет по сравнению со стандартным Git при работе с большими файлами.
import clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Сталкивался ли ты с конфликтами в команде или с руководителем? Как справлялся? Приведи примеры.
С аналитическими функциями (window functions) как работал?
Каковы ваши зарплатные ожидания?