Como montar uma divisão train/val/test e uma referência? Como dividir os dados corretamente?
Machine Learning / AI
Fale sobre a tarefa de avaliação de pronúncia: como abordar a melhoria do modelo que identifica erros na pronúncia de fonemas e sons?
Encontraram LR num carro pequeno, o tamanho do lote aumentou 1000 vezes no cluster. É necessário mudar o LR?
O que fazer se o teste já foi usado e mostrou um resultado ruim?
Que tarefa de classificação estamos a resolver ao avaliar a pronúncia de fonemas?
Quando usar train, validation, test e benchmark?
Existem muitos hiperparâmetros do otimizador, 10.000 experimentos, pouco tempo mas muitos recursos. Que abordagens para procurar a combinação ótima?
Como treinamos o modelo de classificação de fonemas? O que há na meta?
O que entra no classificador além do embedding de áudio?
Que ideias podem ser experimentadas para um alinhamento preciso das fonemas?
Como detectar na prática que um teste se esgotou ou que ocorreu uma mudança de distribuição?
Quando é necessário trocar o teste? Como distinguir entre um caso em que o teste está desatualizado e um caso em que o teste foi consumido devido ao uso múltiplo?
Se o tamanho do lote for maior, o gradiente ficará menor ou maior?
Como fazer alinhamento forçado — determinar de qual segundo a qual segundo cada fonema soa?
A Taxa de Aprendizagem e o Tamanho do Lote são parâmetros independentes? Existe alguma relação entre eles?
Grade 100x100 vs 10000 pontos aleatórios — por que o aleatório é melhor que a grade mesmo em 2D?
Como abordar o treino no seu próprio domínio? O que fazer com o modelo geral?
Como marcar os dados de áudio?
Como treinar o modelo? Seq-to-seq é caro, há muitos hiperparâmetros. Como fazer?
Como abordar o alinhamento de uma única palavra por fonemas? Como usar wav2vec2 para obter limites precisos de fonemas?