W pipeline TTS trening stał się trzy razy wolniejszy, obciążenie GPU 20%, pamięć GPU 90%. Jak znaleźć problem?
Machine Learning / AI
Czy wynik wyrównania i WER to to samo?
Czy zmiany w inferencji mogą powodować pomijanie słów i powtarzanie fraz, i w której części?
MOS wzrosło z 4,1 do 4,3, ale model czasami pomija słowa i powtarza frazy. Co zrobić?
Dlaczego ktoś mógłby wybrać model A z WER 3% zamiast modelu B z WER 2%?
Co oznacza WER = 0,05?
# Uzupełnij tę metodę def __init__(self, nums: List[float]): pass # Uzupełnij tę metodę def dot_product(self, vec: 'SparseVector') -> float: pass
Jak ocenić jakość modelu TTS?
Czy konieczne jest przeprowadzenie normalizacji tekstu podczas preprocessingu lub inferencji?
Czy zawsze konieczne jest przekształcanie tekstu na fonemy?
Co się stanie, jeśli PCM jest nagrany z częstotliwością 8 kHz, ale nagłówek WAV wskazuje 48 kHz, i jak to zabrzmi?
Opowiedz o swoim doświadczeniu z TTS.
Jak przygotować 5000 godzin danych głosowych o nieznanej jakości do treningu TTS?
Czy przeprowadzałeś testy A/B samodzielnie, czy razem z analizą?
Czym są menedżery kontekstowe w Pythonie, do czego służą i gdzie są używane?
Czym różni się DDP od DataParallel?
Czym jest gradient boosting i jak działa?
Jak działa wywoływanie narzędzi w LLM?
Jakie parametry należy użyć do oceny pamięci dla inferencji LLM i jakie optymalizacje architektoniczne zmniejszają KV-cache?
Czy można skonfigurować wyszukiwanie semantyczne dla RAG wiadomości, aby odpowiadało, kto obecnie posiada Cieśninę Ormuz podczas nieregularnych wydarzeń?