En la tubería de TTS, el entrenamiento se ha vuelto tres veces más lento, carga de GPU 20%, memoria de GPU 90%. ¿Cómo encontrar el problema?
Machine Learning / AI
¿La puntuación de alineación y WER son lo mismo?
¿Pueden los cambios en la inferencia causar la omisión de palabras y repeticiones de frases, y en qué parte?
MOS aumentó de 4.1 a 4.3, pero el modelo a veces omite palabras y repite frases. ¿Qué hacer?
¿Por qué alguien podría elegir el modelo A con WER del 3% en lugar del modelo B con WER del 2%?
¿Qué significa WER = 0.05?
# Completa este método def __init__(self, nums: List[float]): pass # Completa este método def dot_product(self, vec: 'SparseVector') -> float: pass
¿Cómo evaluar la calidad de un modelo TTS?
¿Es necesario realizar la normalización del texto durante el preprocesamiento o la inferencia?
¿Es siempre necesario convertir el texto en fonemas?
Si el PCM se graba a 8 kHz, pero la cabecera WAV indica 48 kHz, ¿qué pasará y cómo sonará?
Cuéntenos sobre su experiencia trabajando con TTS.
¿Cómo preparar 5000 horas de datos de voz de calidad desconocida para entrenar TTS?
¿Realizaste pruebas A/B de forma independiente o junto con análisis?
¿Qué son los gestores de contexto en Python, para qué sirven y dónde se usan?
¿En qué se diferencia DDP de DataParallel?
¿Qué es el aumento de gradiente y cómo funciona?
¿Cómo funciona la llamada a herramientas en LLM?
¿Qué parámetros se deben usar para evaluar la memoria en la inferencia de LLM y qué optimizaciones arquitectónicas reducen el KV-cache?
¿Se puede configurar la búsqueda semántica para RAG de noticias para responder quién actualmente posee el Estrecho de Ormuz durante eventos irregulares?