Co je to nucené zarovnání a používal jste ho?
Machine Learning / AI
Jak diagnostikovat a opravit rozdíly v rychlosti řeči a intervalech mezi frázemi?
Jaký je rozdíl mezi WAV a PCM?
Pokud se rychlost řeči a intervaly mezi frázemi liší, jak to diagnostikovat a opravit?
Máte další otázky pro interviewera?
Co dělat, pokud neexistují přepisy pro audio segmenty?
Co je G2P?
Po doladění model začal polykat slova. Jak to diagnostikovat a opravit?
Co dělat po segmentaci VAD?
Proč se v gradient boosting obvykle používají slabé modely?
Existuje zkušenost s distribuovaným tréninkem a co přesně?
Jak zajistit reprodukovatelnost experimentů ML a schopnost obnovit model, pokud byl artefakt smazán v S3?
Lze stavět boosting na lineárních modelech?
Co je třeba uložit v kontrolním bodě, aby bylo možné pokračovat v tréninku po 47 hodinách bez ztráty stavu?
Jaká je asymptotická složitost self-attention a co je KV-cache při inferenci?
Co je normalizovaný text a jak normalizovat běžný text pro TTS?
Jak anotovat nenavázaný audio, pokud různé ASR normalizují text odlišně a přidávají interpunkci?
Jak se bude chovat běžné sémantické vyhledávání v podpůrné znalostní bázi, pokud všechny dokumenty obsahují pozitivní doporučení, ale uživatel se ptá, co by se rozhodně nemělo dělat?
Jak konkrétně aplikovat VAD, aby bylo možné získat kvalitní vzorky?
Jak je implementován strukturovaný výstup jako omezené dekódování?