TTS caurulē apmācība ir kļuvusi trīs reizes lēnāka, GPU slodze 20%, GPU atmiņa 90%. Kā atrast problēmu?
Machine Learning / AI
Vai saskaņošanas rezultāts un WER ir tas pats?
Vai izmaiņas inferencē var izraisīt vārdu trūkumu un frāžu atkārtošanos, un kurā daļā?
MOS pieauga no 4.1 līdz 4.3, bet modelis dažreiz palaidīs vārdus un atkārto frāzes. Ko darīt?
Kāpēc kāds varētu izvēlēties modeli A ar WER 3% vietā modeļa B ar WER 2%?
Ko nozīmē WER = 0,05?
# Pabeidziet šo metodi def __init__(self, nums: List[float]): pass # Pabeidziet šo metodi def dot_product(self, vec: 'SparseVector') -> float: pass
Kā novērtēt TTS modeļa kvalitāti?
Vai ir nepieciešams veikt teksta normalizāciju pirms apstrādes vai inferenču laikā?
Vai vienmēr ir nepieciešams pārvērst tekstu fonēmās?
Ja PCM ierakstīts 8 kHz, bet WAV galvene norāda 48 kHz, kas notiks un kā tas skanēs?
Pastāstiet mums par savu pieredzi ar TTS.
Kā sagatavot 5000 stundu runas datu ar nezināmu kvalitāti TTS apmācībai?
Vai jūs veicāt A/B testus neatkarīgi vai kopā ar analītiku?
Kas ir konteksta pārvaldnieki Pythonā, kam tie paredzēti un kur tiek izmantoti?
Kā atšķiras DDP no DataParallel?
Kas ir gradient boosting un kā tas darbojas?
Kā darbojas rīku izsaukšana LLM?
Kādus parametrus būtu jāizmanto atmiņas novērtēšanai LLM inferencē un kādas arhitektūras optimizācijas samazina KV-kešu?
Vai var konfigurēt semantisko meklēšanu jaunajam RAG, lai atbildētu, kurš pašlaik pieder Hormuzu šaurumam, notiek neregulāriem notikumiem?