Как ORDER BY влияет на таблицу ClickHouse и какие ключи лучше выбирать?
Data Engineer
В таблице records(id) создан обычный B-tree индекс по id. Почему следующий запрос не будет использовать индекс? select * from records where id % 2 = 0 - Для id нужен индекс типа GIN - Индексы не работают с выражениями в WHERE - % — это операция сравнения, а не фильтрации - limit и offset обязательны для оптимизации с индексом - Запрос обращается к числовому полю, а не строковому
Как вы доставляете код DAG-ов до production?
Какие у тебя ожидания от нового проекта?
Какие типы JOIN ты знаешь? Расскажи 2-3 основных.
Как вы загружали данные из S3 в Greenplum?
Какие основные команды Linux вы используете в терминале?
Сколько всего загрузок примерно было — верхнеуровневых джобов, потоков?
Как в Airflow создать много одинаковых тасков параллельно (например, загрузить много одинаковых файлов)?
Из каких основных блоков состоит сообщение трассировки (span)?
В чём опасность shuffle в Spark?
Что такое Catalyst optimizer в Spark и какие конкретные примеры оптимизаций он делает (например, predicate pushdown)?
Есть ли у вас опыт работы с библиотекой Langchain? Какие задачи вы решали с её помощью?
Что происходит при параллелизации запросов в однонодовом Postgres?
Как из Kafka в ClickHouse загружать данные через streaming для real-time отчетности?
Как удалить подмодуль и связанные с ним файлы из проекта? git submodule remove <path-to-submodule> git rm --cached <path-to-submodule>; удалить секцию из .gitmodules; git commit git clean --submodules <path> git submodule delete <path> git remove submodule <path>
Зачем в ClickHouse нужен MergeTree?
Как работает Hash Join?
Какие минусы у MPP архитектуры в Greenplum?
Как выбрать правильный ключ шардирования для равномерного распределения данных?