Кои са основните параметри, които обикновено задаваме за DAG задачите, и защо графикът трябва да бъде точно такъв (висшата логика на DAG)?
Machine Learning / AI
Работили ли сте с Spark? Какво е общото ви мнение за това какво е то?
Когато говорим за метрики при дисбаланс на класовете — кои от тях са адекватни, а кои не?
Дадена е низ, съдържащ букви и цифри. Намерете най-голямото число, срещано в низа (като разглеждате последователните цифри като едно число).
Какво се случва в Python при конкатенация на низове (например, current += char)? Защо този подход може да бъде лош в тази задача и как да оптимизираме кода, като избегнем чести конкатенации на низове?
Сблъсквали ли сте се някога с случаен лес (на работа или в училище)? Какви са основните разлики между случаен лес и буустинг?
Как бихте решили същия проблем с търсенето на последния клик без използване на JOIN?
Работили ли сте с Airflow или Spark? Разкажете ми, какво е DAG в Airflow, можете ли да дадете пример от вашия опит? Сам писахте DAG-ове или просто ги използвахте/стартирахте?
Защо точността при дисбаланс на класовете показва неадекватна стойност на качеството?
Имали ли сте опит с времеви редове? Какви метрики се използват за оценка на качеството на моделите за прогнозиране на времеви редове?
Дадена е таблицата logs с събития на потребители (user_id, item_id, action_type, timestamp). Напишете SQL заявка, за да намерите ID на последния продукт, върху който е кликнал всеки потребител.
Има 100 монети, една от които е фалшива — с двама орли от двете страни. Избираме случайна монета, я хвърляме и излиза орел. Каква е вероятността монетата да е фалшива? Обяснете решението (чрез формулата на Байес).
Ако оптималният брой дървета за модела е 500, но случайно обучихме както случайна гора, така и буустинг на 1000 дървета, кой от моделите е по-вероятно да се пренастрои и защо?
Защо една задача в Spark може да заседне и да работи много дълго?