Hogyan készítsünk train/val/test felosztást és benchmarkot? Hogyan oszd fel helyesen az adatokat?
Machine Learning / AI
Mesélj a kiejtés értékelési feladatról: hogyan közelítsd meg a modellt, amely hibákat azonosít a fonémák és hangok kiejtésében?
Kis autóban találtak LR-t, a klaszterben a batch mérete 1000-szeresére nőtt. Kellene változtatni a LR-t?
Mit tegyünk, ha a tesztet már használták, és rossz eredményt mutatott?
Mikor használjuk a train, validation, test és benchmark-t?
Sok hiperparaméter van a optimalizálóban, 10 000 kísérlet, kevés idő de sok erőforrás. Milyen megközelítések léteznek az optimális kombináció keresésére?
Hogyan tanítjuk a fonéma osztályozó modellt? Mi van a célban?
Milyen osztályozási feladatot oldunk meg a fonémák kiejtésének értékelése során?
Mi kerül a osztályozóba az audio beágyazásán kívül?
Milyen ötleteket lehet kipróbálni a fonémák pontos igazításához?
Mikor kell cserélni a tesztet? Hogyan lehet megkülönböztetni az esetet, amikor a teszt elavult, és az esetet, amikor a teszt több használat miatt elfogyott?
Hogyan lehet gyakorlatban észrevenni, hogy a teszt kifogyott vagy distribution shift történt?
Ha a batch mérete nagyobb, akkor a gradiens kisebb vagy nagyobb lesz?
100x100 rács vs 10000 véletlen pont — miért jobb a véletlen még 2D-ben is, mint a rács?
Hogyan készítsünk kényszerített illesztést — meghatározni, hogy melyik fonéma melyik másodperctől melyik másodpercig hangzik?
A tanulási ráta és a batch mérete független paraméterek? Van közöttük kapcsolat?
Hogyan jelöljük az audio adatokat?
Hogyan közelítsük meg a tanulást a saját domainünkön? Mit tegyünk az általános modellel?
Hogyan közelítsük meg egy szó fonémák szerinti igazítását? Hogyan használhatjuk a wav2vec2-t pontos fonémahatárok eléréséhez?
Hogyan tanítsuk a modellt? A Seq-to-seq drága, sok hiperparaméter van. Hogyan csináljuk?