Ինչպես հավաքել train/val/test բաժանումը և բենչմարկը: Ինչպես ճիշտ բաժանել տվյալները?
Machine Learning / AI
Պատմեք արտասանության գնահատման առաջադրանքի մասին՝ ինչպես մոտենալ մոդելի բարելավմանը, որը որոշում է ֆոնեմների և ձայնների արտասանության սխալները:
Նայեցին LR փոքր մեքենայի վրա, բեռի չափը 1000 անգամ աճեց cluster-ում: Պետք է փոխել LR?
Ի՞նչ անել, եթե թեստը արդեն օգտագործվել է և ցույց է տվել վատ արդյունք։
Երբ օգտագործել train, validation, test և benchmark?
Կան շատ հիպերպարամետրեր օպտիմիզատորի համար, 10000 փորձեր, քիչ ժամանակ բայց շատ ռեսուրսներ։ Որոնք են լավագույն համադրությունը գտնելու մոտեցումները։
Ի՞նչ է մտնում դասակարգիչը բացի աուդիո ներդրմանից։
Ինչպե՞ս ենք ուսուցանում ֆոնեմների դասակարգման մոդելը: Ի՞նչ է թիրախում:
Ի՞նչ դասակարգման խնդիր ենք լուծում ֆոնեմների արտասանության գնահատման ժամանակ։
Ի՞նչ գաղափարներ կարելի է փորձել ֆոնեմների ճշգրիտ հարթեցման համար։
Ինչպե՞ս գործնականում զգալ, որ թեստը սպառվել է կամ տեղի է ունեցել բաշխման փոփոխություն։
Երբ է պետք փոխել թեստը: Ինչպե՞ս տարբերել այն դեպքը, երբ թեստը հնացել է, և այն դեպքը, երբ թեստը սպառվել է բազմակի օգտագործումից հետո։
Եթե բեթչի չափը մեծ է, արդյոք գրադիենտը փոքր կլինի կամ մեծ?
Ինչպե՞ս կատարել պարտադիր հարմարվողականություն — որոշել, թե որ ֆոնեմը որ վայրկյանից մինչև որ վայրկյան է հնչում։
Ուսուցման արագությունը և խմբաքանակի չափը անկախ պարամետրեր են։ Կա՞ կապ նրանց միջև։
Ինչու՞ ռանդոմը ավելի լավ է, նույնիսկ 2D-ում՝ համեմատած ցանցի հետ:
Ինչպես նշել աուդիո տվյալները?
Ինչպե՞ս մոտենալ ձեր դոմենում ուսուցմանը: Ինչ անել ընդհանուր մոդելով?
Ինչպե՞ս ուսուցանել մոդելը: Seq-to-seq թանկ է, շատ հիպերպարամետրեր կան: Ինչպե՞ս անել դա:
Ինչպես մոտենալ մեկ բառի ֆոնեմների համապատասխանեցմանը: Ինչպես օգտագործել wav2vec2՝ ճշգրիտ ֆոնեմների սահմանները ստանալու համար: