¿Cómo crear una división de train/val/test y un benchmark? ¿Cómo dividir los datos correctamente?
Machine Learning / AI
Cuéntame sobre la tarea de evaluación de la pronunciación: ¿cómo abordar la mejora del modelo que detecta errores en la pronunciación de fonemas y sonidos?
¿Encontraron LR en un coche pequeño, el tamaño del lote aumentó en 1000 veces en el clúster. ¿Es necesario cambiar LR?
¿Qué hacer si la prueba ya se ha utilizado y mostró un mal resultado?
¿Cuándo usar train, validation, test y benchmark?
Hay muchos hiperparámetros del optimizador, 10,000 experimentos, poco tiempo pero muchos recursos. ¿Qué enfoques para buscar la combinación óptima?
¿Qué se introduce en el clasificador además de la incrustación de audio?
¿Qué tarea de clasificación estamos resolviendo al evaluar la pronunciación de fonemas?
¿Cómo entrenamos el modelo de clasificación de fonemas? ¿Qué hay en el objetivo?
¿Qué ideas se pueden probar para una alineación precisa de las fonemas?
¿Cuándo es necesario cambiar la prueba? ¿Cómo distinguir entre un caso en el que la prueba está desactualizada y un caso en el que la prueba se ha agotado debido a un uso múltiple?
¿Cómo detectar en la práctica si una prueba se ha agotado o si ha ocurrido un cambio de distribución?
Si el tamaño del lote es mayor, ¿el gradiente será menor o mayor?
¿Cómo hacer alineación forzada — determinar qué fonema suena desde qué segundo hasta qué segundo?
¿Por qué el muestreo aleatorio es mejor que la cuadrícula incluso en 2D: una comparación entre una cuadrícula 100x100 y 10,000 puntos aleatorios?
¿ La tasa de aprendizaje y el tamaño de lote son parámetros independientes? ¿Existe alguna relación entre ellos?
¿Cómo etiquetar los datos de audio?
¿Cómo abordar la alineación de una sola palabra por fonemas? ¿Cómo usar wav2vec2 para obtener límites precisos de fonemas?
¿Cómo abordar el entrenamiento en tu propio dominio? ¿Qué hacer con el modelo general?
¿Cómo entrenar el modelo? Seq-to-seq es costoso, hay un montón de hiperparámetros. ¿Cómo hacerlo?