V pipeline TTS se trénink stal třikrát pomalejší, zatížení GPU 20 %, paměť GPU 90 %. Jak najít problém?
Machine Learning / AI
Je skóre zarovnání a WER totéž?
Mohou změny v inferenci způsobit chybějící slova a opakování frází, a v které části?
MOS vzrostl z 4,1 na 4,3, ale model někdy vynechává slova a opakuje fráze. Co dělat?
Proč by někdo zvolil model A s WER 3 % místo modelu B s WER 2 %?
Co znamená WER = 0,05?
# Dokončete tuto metodu def __init__(self, nums: List[float]): pass # Dokončete tuto metodu def dot_product(self, vec: 'SparseVector') -> float: pass
Jak hodnotit kvalitu modelu TTS?
Je nutné provádět normalizaci textu během předzpracování nebo inference?
Je vždy nutné převést text na fonémy?
Co se stane, pokud je PCM zaznamenáno na 8 kHz, ale hlavička WAV uvádí 48 kHz, a jak to bude znít?
Povězte nám o své zkušenosti s TTS.
Jak připravit 5000 hodin hlasových dat neznámé kvality pro trénink TTS?
Provedli jste A/B testy samostatně nebo společně s analytikou?
Co jsou to správci kontextu v Pythonu, k čemu slouží a kde se používají?
V čem se DDP liší od DataParallel?
Co je to gradient boosting a jak funguje?
Jak funguje volání nástrojů v LLM?
Jaké parametry je třeba použít k hodnocení paměti pro inference LLM a jaké architektonické optimalizace snižují KV-cache?
Lze nakonfigurovat sémantické vyhledávání pro RAG zpráv, aby odpovídalo na otázku, kdo v současnosti vlastní Hormuzský průliv během nepravidelných událostí?