Cum se creează o împărțire train/val/test și un benchmark? Cum se împarte corect datele?
Machine Learning / AI
Povestește-mi despre sarcina de evaluare a pronunției: cum să abordezi îmbunătățirea modelului care detectează greșelile în pronunția fonemelor și sunetelor?
Au găsit LR pe o mașină mică, dimensiunea batch-ului a crescut de 1000 de ori în cluster. Este necesar să schimbați LR?
Ce să faci dacă testul a fost deja folosit și a arătat un rezultat slab?
Când să folosiți train, validation, test și benchmark?
Există mulți hiperparametri ai optimizerului, 10.000 de experimente, puțin timp dar multe resurse. Ce abordări pentru a găsi combinația optimă?
Cum antrenăm modelul de clasificare a fonemelor? Ce este în țintă?
Ce intră în clasificator în afară de embedding-ul audio?
Ce sarcină de clasificare rezolvăm la evaluarea pronunției fonemelor?
Ce idei pot fi încercate pentru alinierea precisă a fonemelor?
Când trebuie schimbat testul? Cum se face diferența între cazul în care testul este învechit și cazul în care testul s-a epuizat din cauza utilizării multiple?
Cum să detectați în practică dacă un test s-a epuizat sau dacă a avut loc o schimbare de distribuție?
Dacă mărimea batch-ului este mai mare, gradientul va fi mai mic sau mai mare?
Cum să faci alinierea forțată — să determini de la ce secundă până la ce secundă sună fiecare fonem?
Grilă 100x100 vs 10000 puncte aleatorii — de ce randomul este mai bun decât grila chiar și în 2D?
Rata de învățare și dimensiunea batch-ului sunt parametri independenți? Există o legătură între ei?
Cum se etichetează datele audio?
Cum să abordezi alinierea unui cuvânt pe foneme? Cum să folosești wav2vec2 pentru a obține limite precise ale fonemelor?
Cum să abordezi antrenamentul pe domeniul tău? Ce faci cu modelul general?
Cum să antrenezi modelul? Seq-to-seq este costisitor, există o mulțime de hiperparametri. Cum faci asta?