Machine Learning / AI
Кайда cross-encoder, кайда bi-encoder колдонуу ылайыктуу издөөдө?
Жобаларыңызда LLM-ден структураланган чыгышты (structured output) кантип жасайсыз?
Көмөкчүдүн жооптору боюнча колдонуучулардын пикирлерин кантип аласыз?
Агрегаттык функциялар жана GROUP BY жок толук талаалар топтому менен SQL суроо кандай иштейт?
Биз эки жактуу классификация маселесин чечип жатабыз. Позитивдүү класс үлүшү үлгүдө 5%. Модель 95% тактык көрсөтүп жатат. Мындай моделдин сапаты жөнүндө эмне айтууга болот?
Космостук сүрөттөрүнүн семантикалык бөлүнүшү эмнеге жана кайсы моделдер колдонулат?
Кайсы токенизация түрлөрүн билесиз? Артыкчылыктары жана кемчиликтери.
AutoML кайсы тапшырмаларды начар чечет (кичине маалыматтар, стандарт эмес домендик билимдер)?
Агент менен жөнөкөй LLMдин айырмасы эмнеде?
Лейблирлөө функциялары эмне?
Сиздин өнүктүрүү процессиңиз кандай — моделдерди Dockerго чейин жеткизесиз, аларды оралап жана башка бирөөгө өткөрөсүзбү?
Airflow колдонуп автоматтык маалымат топтоо жана окутууну кантип уюштуруу керек?
Маалыматтар түзүлмө таблица түрүндө сакталганбы? Сен өзүң иштеп чыктыңбы же кимдир бирөө сен үчүн жасадыбы?
Вектордун өлчөмүн жана аралык метриканы тандоодо кандайча ката кетирилет?
Кайсы жыйынтыктоо функциялары бар?
RAG эмне? Түшүндүрүп бере аласызбы?
Эгер убакыт серияларын алдын ала болжош ишинде максатта нөлдөр же төмөнкү маанилер кездешсе, кайсы сапат метрикасы жакшы: MAPE, SMAPE же WAPE?
Маалыматтарда жетишпеген маанилер менен иштөө, анын ичинде убакыт серияларында?
Практик тапшырма 80 миллион билдирүү үчүн SQL суроо JOINден кийин дублёторду түзөт. Кайсы аракет биринчи башталары жакшы? - Оптимизациядан мурун JOIN кардиналдуулугун, ачкычтарды жана аткаруу планынын планын текшерүү. - Бир байланыш талаасында индекс түзүү. - Натыйжаны CSVге экспорттоо жана Pythonда дублёторду жоюу. - Ар дайым бардык багыттарга DISTINCT кошуу. - Натыйжаны үлгүдө текшергандан кийин DISTINCT кошуу. - Байланыш ачкычтарын жана эки таблицанын уникалдуулугун текшерүү.
Учурдагы компаниядан эмне үчүн кетип жатасыз?