`eval()` режиминде BatchNorm'ду туура эмес колдонуу алдын ала болбогон каталарга алып келди деген мисал келтириңиз.
Machine Learning / AI
Практик тапшырма Кайсы артефакттар жыйнагы эки LoRA ишке ашыруунун адилеттүү салыштыруу үчүн мүмкүндүк берет? - Тек соңку сапат таблицасы. - Код менен акыркы метриканын скриншоту менен commit. - Эксперименттин коду жана конфигурация файлы. - Код, маалыматтардын хеши, негизги модель, LoRA конфигурациясы, көзкарандылыктар жана иштетүү командасы. - Тек Git тармагынын шилтемеси. - Код, LoRA параметрлери, негизги моделдин версиясы жана көзкарандылыктар.
Азыр Yandex же Alfa сыяктуу чоң технологиялык компанияларда интервьюлар барбы?
Практик тапшырма 80 миллион билдирүү үчүн SQL суроо JOINден кийин дублёторду түзөт. Кайсы аракет биринчи башталары жакшы? - Оптимизациядан мурун JOIN кардиналдуулугун, ачкычтарды жана аткаруу планынын планын текшерүү. - Бир байланыш талаасында индекс түзүү. - Натыйжаны CSVге экспорттоо жана Pythonда дублёторду жоюу. - Ар дайым бардык багыттарга DISTINCT кошуу. - Натыйжаны үлгүдө текшергандан кийин DISTINCT кошуу. - Байланыш ачкычтарын жана эки таблицанын уникалдуулугун текшерүү.
Жаңы моделдин версиясинен кийин орто сапат баалоо өстү, бирок редакторлор юридикалык жана каржылык темаларга жооптордун кыйла начарлашын айтышууда. Баштапкы визуализацияны кайсынысы болот, чыгарууну токтотуу керекпи же жокпу чечүү үчүн?
Мындай эксперименттерде маалыматтардын жана моделдердин версияларын адатта кантип башкарасыз?
Филиппиндерде калууну же башка өлкөгө көчүүнү пландап жатасызбы?
Суроолордо сизге эмне үчүн "басымдуу" көрүнгөнүн жана бул сиздин интервьюга карата кабылдашыңызга кандай таасир эткенин көбүрөөк түшүндүрүп бере аласызбы?
Толугу менен англисче сүйлөгөн командаларда иштөө тажрыйбасыңыз барбы?
ИИ менен интервью өткөрүү тажрыйбасыңыз барбы?
Башка компанияларда сунуштар же акыркы этаптар барбы?
Чыгымдардын моделдин метрикаларына, мисалы, такыгы же F1-scoreго, сандык баалоо кандай болот?
Кантип бириктирүү ачкычтары боюнча индекстерди оптималдаштырып, дублдуулукту азайтып, суроо-талапты тездетесиз?
Тасаввур кылыңыз, сиз PyTorch модел менен иштеп жатасыз жана аны eval() режимине өткөргандан кийин, 10 000 мисалдан турган так тест топтомунда метрикалар ар бир ишке киргизүүдө өзгөрүп турат. Репродукциялүүлүк үчүн, кездейсоқ сандар генераторлорунун баштапкы абалын белгилейсиз: башка кайсы жерде өзгөрүүлөрдүн булагы жашырын болушу мүмкүн? Dropout, BatchNorm жана torch.no_grad() ролун түшүндүрүңүз жана натыйжалардын туруктуулугун текшерүү үчүн белгиленген метрикаларды жана алардын чек араларын атаңыз.
CEFR деңгээлдерине ылайык окуу/жазуу жана сүйлөө үчүн англис тилиңизди өзүнчө баалаңыз.
Бул суроодо иштөө көйгөйлөрүн аныктоо үчүн `EXPLAIN`-ди кандай колдонсоңуз болот?
Практик тапшырма AI бардык 2 миллион тазаланбаган диалогго LoRA үйрөтүүнү сунуштайт. Арыздоочунун эң жетилген жообу кайсы? - AI'га ишенүү: чоң корпус ката-ошолорду өзү теңдештирет. - Маалыматтарды өзгөртпөстөн, биринчи промтту өзгөрт. - Тазаланган бөлүктө LoRA үйрөтүп, негизги модел менен салыштыр. - Өргөтүү алдында белгилердин кездейсоқ үлгүсүн текшер. - Алгач маалыматтарды жана сапатты темалар боюнча өзүнчө топто, андан соң чектелген түрдө LoRA үйрөт. - Бардык корпус боюнча үйрөт, бирок LoRAнын даражасын азайту.
Кайсы расмий формат сиз үчүн ыңгайлуу: GPH, IP же TК?
Диалогтордун таблицасында 80 миллион билдирүү бар, жана баалоо топтому үчүн аналитикалык суроо 25 мүнөттөн ашык убакыт алат жана кээде суроо-жооп парларын кайталап берет. Биринчиден эмне оңдойсуз жана эмнеге?
Суроолор түзүү үчүн чоң тил модели сирек темаларда стилин кармап кала албайт. AI жардамчысы 2 миллион диалогдон турган тарыхый корпусунда дароо LoRAны ишке киргизүүнү сунуштайт, бирок белгилөө кээде шуугучтуу. Эмне учурларда сиз бул кеңешке ишенбейт жана биринчи эмне тандайсыз?