Обмисляш само позицията на ML инженер или също и Data Scientist?
Machine Learning / AI
Как LLM извиква инструменти или MCP, ако ги имаме?
Какви трудности възникват при използването на Word2Vec и NLTK за руски език?
В таблицата с диалози има 80 милиона съобщения, а аналитичният заявка за оценъчния набор отнема 25 минути и понякога връща дублиращи се двойки въпрос-отговор. Какво ще поправите първо и защо?
За генериране на въпроси, големият езиков модел трудно поддържа стила при редки теми. AI асистентът предлага веднага да стартира LoRA върху цялостния исторически корпус от 2 милиона диалога, но маркировката е частично шумна. В кои случаи не бихте се доверили на този съвет и какво бихте избрали първо?
Каква е разликата между GET и POST заявки?
Обикновено как се различава ChatGPT от асистент в рамките на компанията (чат-бот срещу асистент)?
Разкажи за проектите си: какво точно си правил, технически подробно?
С кои инструменти за градиентно буустиране сте работили? CatBoost, LightGBM, XGBoost?
Как да подходите към подравняването на една дума по фонеми? Как да използваме wav2vec2 за получаване на точни граници на фонемите?
Как да се справим с проблема с растежа на контекста при активен диалог с потребителя?
Какви са основните разлики между машинното обучение и дълбокото обучение?
Защо структурираният изход винаги генерира валиден JSON? На какво ниво се реализира това?
Колко характеристики ще вземете от feature store и как ще ги изберете, ако всички 5000 характеристики са валидни и без течове?
Какво ви вдъхновява в работата?
Какво ще се случи, ако подадете към декодера последователност с дължина 10k токена, а моделът е обучен на 9k?
Как бяха маршрутизирани между агентите? Дайте пример за условия на превключване.
Какво ще се случи с качеството на модела, ако премахнем първото и последното дърво в случайния лес и градиентното буустинг?
Каква е ролята на Aston в работния процес на проекта?
Разкажете последователно за проекта за прогнозиране на текучеството на служителите: бизнес-задача, формулиране на ML-задача, метрики и данни.