Kako napraviti podelu train/val/test i benchmark? Kako pravilno podeliti podatke?
Machine Learning / AI
Ispričaj mi o zadatku procjene izgovora: kako pristupiti poboljšanju modela koji prepoznaje pogreške u izgovoru fonema i zvukova?
Na malom automobilu su pronašli LR, veličina batch-a je porasla 1000 puta u klasteru. Da li treba da menjam LR?
Šta uraditi ako je test već korišćen i pokazao loš rezultat?
Када користити train, validation, test и benchmark?
Postoji mnogo hiperparametara optimizatora, 10.000 eksperimenata, malo vremena ali mnogo resursa. Koji su pristupi za pronalaženje optimalne kombinacije?
Šta ulazi u klasifikator pored audio embedinga?
Koji zadatak klasifikacije rešavamo pri oceni izgovora fonema?
Kako obučavamo model za klasifikaciju fonema? Šta je u cilju?
Koje ideje se mogu isprobati za tačno poravnanje fonema?
Kako na praksi prepoznati da je test istekao ili da je došlo do promene distribucije?
Када је потребно променити тест? Како разликовати случај када је тест истекао од случаја када је тест истрошен због више пута коришћења?
Ako je veličina batch-a veća, da li će gradijent biti manji ili veći?
Kako napraviti prinudno usklađivanje — odrediti od koje do koje sekunde svira svaka fonema?
Brzina učenja i veličina serije su nezavisni parametri? Postoji li veza između njih?
Zašto je nasumično bolje od mreže čak i u 2D: poređenje između mreže 100x100 i 10.000 nasumičnih tačaka?
Kako pristupiti obuci na svom domenu? Šta uraditi sa generalnim modelom?
Kako označiti audio podatke?
Kako obučiti model? Seq-to-seq je skup, ima mnogo hiperparametara. Kako to uraditi?
Kako pristupiti usklađivanju jedne reči po fonemima? Kako koristiti wav2vec2 za dobijanje tačnih granica fonema?