Come creare una suddivisione train/val/test e un benchmark? Come dividere correttamente i dati?
Machine Learning / AI
Parlami del compito di valutazione della pronuncia: come affrontare il miglioramento del modello che identifica gli errori nella pronuncia di fonemi e suoni?
Hanno trovato LR su una piccola macchina, la dimensione del batch è aumentata di 1000 volte nel cluster. È necessario cambiare LR?
Cosa fare se il test è già stato usato e ha mostrato un risultato negativo?
Quando usare train, validation, test e benchmark?
Ci sono molti iperparametri dell'ottimizzatore, 10.000 esperimenti, poco tempo ma molte risorse. Quali approcci per trovare la combinazione ottimale?
Cosa entra nel classificatore oltre all'embedding audio?
Quale compito di classificazione stiamo risolvendo nella valutazione della pronuncia dei fonemi?
Come addestriamo il modello di classificazione dei fonemi? Cosa c'è nel target?
Quali idee si possono provare per un allineamento preciso delle fonemi?
Quando è necessario cambiare il test? Come distinguere tra un caso in cui il test è obsoleto e un caso in cui il test si è esaurito a causa di un uso multiplo?
Come capire nella pratica se un test è esaurito o se si è verificato uno spostamento di distribuzione?
Se la dimensione del batch è maggiore, il gradiente sarà più piccolo o più grande?
Come fare l'allineamento forzato — determinare da quale secondo a quale secondo ogni fonema viene pronunciato?
Perché il campionamento casuale è migliore della griglia anche in 2D: confronto tra una griglia 100x100 e 10.000 punti casuali?
Learning Rate e Batch Size sono parametri indipendenti? C'è una relazione tra loro?
Come etichettare i dati audio?
Come affrontare l'allineamento di una singola parola per fonemi? Come usare wav2vec2 per ottenere confini precisi dei fonemi?
Come approcciarsi all'addestramento sul proprio dominio? Cosa fare con il modello generale?
Come addestrare il modello? Seq-to-seq è costoso, ci sono molti iperparametri. Come farlo?