Какво е операторът HAVING в SQL? Къде се използва?
Machine Learning / AI
Задача по регресия: предсказване на цената на акциите за 5-ия година въз основа на данни за 4 години с помощта на бустинг. Каква грешка направихме?
Какви са метриките MAPE и SMAPE? Къде могат да бъдат неефективни?
Разкажете ни за проекта за оценка на качеството на работата на диспетчърите: кои модели са използвани, как са сравнявани с еталонния скрипт?
Защо CatBoost, а не XGBoost или LightGBM? Какви са разликите?
MVP задача: бинарна класификация с дисбаланс на класовете, данните са разпределени на 10 машини, има текстова характеристика. Какъв подход бихте предложили?
Разкажете за проекта за клъстеризация на заявки с маркиране по бизнес-важност.
Кои метрики са най-важни при голям дисбаланс на класовете (99 към 1)?
Знаете ли протоколите HTTP, UDP, TLS?
Каква е основната разлика между Spark и Pandas? Какво е Hadoop?
Знаете ли какво е bagging? Дайте пример за алгоритъм.
Какво е LoRA (Low-Rank Adaptation)?
Разкажете за алгоритъма K-means и неговите напреднали аналози (K-means++).
Разкажете повече за проекта за прогнозиране на текучеството на служителите: какво правихте, какви данни използвахте, защо избрахте CatBoost?
Разкажете за себе си, опита си и проектите си.
Какви метрики се използват за оценка на качеството на клъстеризацията? Как да изберем броя на клъстерите?