Kā izveidot train/val/test sadalījumu un benchmarku? Kā pareizi sadalīt datus?
Machine Learning / AI
Pastāsti par runas novērtējuma uzdevumu: kā pieiet modeļa uzlabošanai, kas identificē kļūdas fonēmu un skaņu izrunā?
Mazā mašīnā atrada LR, klasterī partijas lielums pieauga 1000 reizes. Vai ir nepieciešams mainīt LR?
Ko darīt, ja tests jau ir izmantots un parādīja sliktu rezultātu?
Kad izmantot train, validation, test un benchmark?
Ir daudz hiperparametru optimizatoram, 10 000 eksperimentu, maz laika, bet daudz resursu. Kādas pieejas ir visefektīvākās optimālās kombinācijas meklēšanai?
Kas iekļauts klasifikatorā, izņemot audio iekļaušanu?
Kā mēs apmācām fonēmu klasifikācijas modeli? Kas ir mērķī?
Kādu klasifikācijas uzdevumu mēs risinām, novērtējot fonēmu izrunu?
Kādas idejas varētu izmēģināt, lai precīzi izlīdzinātu fonēmas?
Kā praktiski noteikt, vai tests ir izsmelts vai ir noticis sadalījuma maiņa?
Kad jāmaina tests? Kā atšķirt gadījumu, kad tests ir novecojis, no gadījuma, kad tests ir izdegis daudzreizējas lietošanas dēļ?
Ja partijas lielāka, vai gradients būs mazāks vai lielāks?
Kā veikt piespiedu saskaņošanu — noteikt, no kura līdz kura sekundes skan katra fonēma?
Kāpēc nejaušais paraugs ir labāks par režģi pat arī 2D: salīdzinājums starp 100x100 režģi un 10 000 nejaušiem punktiem?
Mācīšanās ātrums un partijas lielums ir neatkarīgi parametri? Vai starp tām ir saistība?
Kā marķēt audio datus?
Kā pieiet mācībām savā domēnā? Ko darīt ar vispārējo modeli?
Kā pieiet vienas vārda saskaņošanai pēc fonēmām? Kā izmantot wav2vec2, lai iegūtu precīzas fonēmu robežas?
Kā apmācīt modeli? Seq-to-seq ir dārgs, ir daudz hiperparametru. Kā to izdarīt?