Kuidas koostada train/val/test ja benuhmärk? Kuidas andmeid õigesti jagada?
Machine Learning / AI
Räägi mulle häälduse hindamise ülesandest: kuidas läheneda mudeli parandamisele, mis tuvastab vigu fonemite ja helide häälduses?
Leidsid LR väikese autos, partii suurus kasvas klastris 1000 korda. Kas peaksin muutma LR?
Mida teha, kui test on juba kasutatud ja näitas halba tulemust?
Millal kasutada train, validation, test ja benchmark?
On palju hüperparameetreid optimeerijal, 10 000 eksperimenti, vähe aega, kuid palju ressursse. Millised lähenemisviisid on parimad optimaalse kombinatsiooni otsimiseks?
Kuidas me koolitame fonemide klassifikatsioonimudelit? Mis on sihtmärgil?
Mis kuulub klassifikaatorisse lisaks heli sisestusele?
Millist klassifikatsioonitööd me lahendame fonemide häälduse hindamisel?
Milliseid ideid saab proovida fonemide täpseks joondamiseks?
Millal tuleb testi vahetada? Kuidas eristada olukorda, kus test on vananenud, ja olukorda, kus test on kulunud mitmekordse kasutamise tõttu?
Kuidas praktikas testi lõppemise või jaotuse muutumise ära tundmine?
Kui partii suurus on suurem, kas gradient muutub väiksemaks või suuremaks?
Kuidas teha sunnitud joondamine — määrata, millest milleni iga fonem kuuleb?
Miks juhuslik proov on parem kui võrk isegi 2D-s: võrdlus 100x100 võrgu ja 10 000 juhusliku punktiga?
Õppimiskiirus ja partii suurus on sõltumatud parameetrid? Kas nende vahel on seos?
Kuidas märkida helandmed?
Kuidas läheneda ühe sõna joondamisele fonemide järgi? Kuidas kasutada wav2vec2, et saada täpseid fonemide piire?
Kuidas läheneda oma domeeni koolitusele? Mida teha üldmudeliga?
Kuidas treenida mudelit? Seq-to-seq on kallis, on palju hüperparameetreid. Kuidas seda teha?