Machine Learning / AI
Кои са основните функции, използвани за класифициране на спам в лийдовете?
Какво е pairwise предпочитание и как да го изчислим?
Архитектурни различия между XGBoost, LightGBM и CatBoost: как се строят дърветата?
Може ли да добавите поле към таблицата вместо да използвате SELECT заявка?
Защо теглата на модела могат да станат големи и защо е необходимо да ги намаляваме с регуляризация?
Какви метрики се използват за сегментация и детекция на обекти?
Правили ли сте решения за клиентите на работодателя — те ги вземаха и ги поддържаха сами?
Защо BERT дава по-добро качество при задачи за класификация на текст, отколкото TF-IDF с логистична регресия?
Как да създадем и обучим класификатор в PyTorch?
Как работи токенизацията? Защо се използват subword токени, а не цели думи?
Защо да използваме списъци за съхраняване на предишните стойности?
Какво е косинус спрямо скаларното произведение и евклидовото разстояние — как влияе нормализацията?
Как да тренирате с голям пакет при ограничена памет?
Как да работим с непълни данни от различни сървъри и таблици?
Беше ли направен dropout въз основа на загуба или случайно изключване на тегла?
Разкажете ми за опита си в анализа на данни, проекти и курсове.
Какво е BatchNorm?
Как да организираме съхранението на данни, като вземем предвид данните от няколко източника: бекенд база данни, кликстрийм, CRM и комуникации?
Как се оптимизира inference?
Какво може да се обърка в модела?