Jak sestavit train/val/test rozdělení a benchmark? Jak správně rozdělit data?
Machine Learning / AI
Pověz mi o úloze hodnocení výslovnosti: jak přistoupit ke zlepšení modelu, který detekuje chyby ve výslovnosti fonémů a zvuků?
Na malém autě našli LR, velikost batch se v clusteru zvýšila 1000krát. Je třeba změnit LR?
Co dělat, pokud byl test již použit a ukázal špatný výsledek?
Kdy používat train, validation, test a benchmark?
Existuje mnoho hyperparametrů optimalizátoru, 10 000 experimentů, málo času, ale hodně zdrojů. Jaké přístupy k hledání optimální kombinace?
Co se do klasifikátoru vkládá kromě vložení zvuku?
Jaký úkol klasifikace řešíme při hodnocení výslovnosti fonémů?
Jak trénujeme model klasifikace fonémů? Co je v cíli?
Jaké nápady lze vyzkoušet pro přesné zarovnání fonémů?
Kdy je třeba test vyměnit? Jak rozpoznat případ, kdy je test zastaralý, od případu, kdy test vyhořel kvůli opakovanému použití?
Jak v praxi poznat, že test došel nebo došlo ke změně rozdělení?
Pokud je velikost dávky větší, bude gradient menší nebo větší?
Jak udělat nucené zarovnání — určit, od které sekundy do které sekundy zní každá fonéma?
Proč je náhodné vzorkování lepší než mřížka i v 2D: srovnání mřížky 100x100 a 10 000 náhodných bodů?
Učební rychlost a velikost dávky jsou nezávislé parametry? Existuje mezi nimi vztah?
Jak označit zvuková data?
Jak přistupovat k zarovnání jednoho slova podle fonémů? Jak používat wav2vec2 k získání přesných hranic fonémů?
Jak přistoupit k tréninku na své doméně? Co dělat s obecným modelem?
Jak trénovat model? Seq-to-seq je drahý, je spousta hyperparametrů. Jak to udělat?