Jak stworzyć podział train/val/test i benchmark? Jak poprawnie podzielić dane?
Machine Learning / AI
Opowiedz o zadaniu oceny wymowy: jak podejść do ulepszania modelu, który wykrywa błędy w wymowie fonemów i dźwięków?
Znaleźli LR na małym samochodzie, rozmiar partii wzrósł w klastrze 1000 razy. Czy należy zmienić LR?
Co zrobić, jeśli test został już użyty i pokazał słaby wynik?
Kiedy używać train, validation, test i benchmark?
Istnieje wiele hiperparametrów optymalizatora, 10 000 eksperymentów, mało czasu, ale dużo zasobów. Jakie podejścia do znalezienia optymalnej kombinacji?
Jak uczymy model klasyfikacji fonemów? Co jest w celu?
Co wchodzi do klasyfikatora oprócz osadzenia audio?
Jakie zadanie klasyfikacji rozwiązujemy podczas oceny wymowy fonemów?
Jakie pomysły można wypróbować, aby dokładnie wyrównać fonemy?
Kiedy należy wymienić test? Jak odróżnić przypadek, gdy test jest nieaktualny, od przypadku, gdy test wyczerpał się z powodu wielokrotnego użycia?
Jak w praktyce rozpoznać, że test się wyczerpał lub doszło do zmiany rozkładu?
Jeśli rozmiar partii jest większy, czy gradient będzie mniejszy czy większy?
Jak zrobić wymuszone dopasowanie — określić, z której do której sekundy brzmi każda fonema?
Dlaczego losowe punkty są lepsze od siatki, nawet w 2D: porównanie siatki 100x100 i 10 000 losowych punktów?
Współczynnik uczenia się i rozmiar partii to niezależne parametry? Czy istnieje między nimi związek?
Jak oznaczyć dane audio?
Jak podejść do wyrównania pojedynczego słowa według fonemów? Jak używać wav2vec2 do uzyskania dokładnych granic fonemów?
Jak podejść do szkolenia na własnej domenie? Co zrobić z modelem ogólnym?
Jak trenować model? Seq-to-seq jest kosztowne, jest wiele hiperparametrów. Jak to zrobić?