Qu'est-ce que l'alignement forcé et l'avez-vous utilisé?
Machine Learning / AI
Comment diagnostiquer et corriger les différences de vitesse et d'intervalle entre les phrases?
Quelle est la différence entre WAV et PCM?
Si la vitesse de parole et les intervalles entre les phrases diffèrent, comment diagnostiquer et corriger?
Avez-vous des questions supplémentaires pour l'intervieweur?
Que faire s'il n'y a pas de transcriptions pour les segments audio?
Qu'est-ce que G2P?
Après un ajustement fin, le modèle a commencé à avaler des mots. Comment diagnostiquer et corriger?
Que faire après la segmentation VAD?
Pourquoi utilise-t-on généralement des modèles faibles dans le gradient boosting?
Y a-t-il une expérience avec la formation distribuée et laquelle exactement?
Comment assurer la reproductibilité des expériences ML et la capacité de restaurer le modèle si l'artefact a été supprimé dans S3?
Peut-on construire du boosting sur des modèles linéaires?
Que doit-on sauvegarder dans le point de contrôle pour continuer l'entraînement après 47 heures sans perdre l'état?
Quelle est la complexité asymptotique de l'auto-attention et qu'est-ce que le cache KV lors de l'inférence?
Qu'est-ce qu'un texte normalisé et comment normaliser un texte ordinaire pour TTS?
Comment annoter un audio non annoté si différents ASR normalisent le texte différemment et ajoutent la ponctuation?
Comment se comportera la recherche sémantique régulière dans une base de connaissances de support si tous les documents contiennent des recommandations positives, mais l'utilisateur demande ce qu'il ne faut surtout pas faire?
Comment appliquer spécifiquement VAD pour obtenir des échantillons de qualité?
Comment la sortie structurée est-elle implémentée en tant que décodage contraint?