Wat is forced alignment en heb je het gebruikt?
Machine Learning / AI
Hoe diagnoseer en los je verschillen in spraaktempo en intervallen tussen zinnen op?
Wat is het verschil tussen WAV en PCM?
Als de spraaktempo en de intervallen tussen zinnen verschillen, hoe diagnoseer en los je dat op?
Heb je nog aanvullende vragen voor de interviewer?
Wat te doen als er geen transcripties zijn voor audiosegmenten?
Wat is G2P?
Na fine-tuning begon het model woorden te inslikken. Hoe diagnoseer en los je dat op?
Wat te doen na VAD-segmentatie?
Waarom worden zwakke modellen meestal gebruikt in gradient boosting?
Is er ervaring met distributed training en wat precies?
Hoe garandeer je reproduceerbaarheid van ML-experimenten en de mogelijkheid om het model te herstellen als het artefact in S3 is verwijderd?
Kan boosting worden gebouwd op lineaire modellen?
Wat moet er in het checkpoint worden opgeslagen om de training na 47 uur voort te zetten zonder de staat te verliezen?
Wat is de asymptotische complexiteit van self-attention en wat is de KV-cache bij inferentie?
Wat is genormaliseerde tekst en hoe normaliseer je gewone tekst voor TTS?
Hoe annoteren we niet-annotatie audio als verschillende ASR's de tekst verschillend normaliseren en interpunctie toevoegen?
Hoe zal reguliere semantische zoekopdrachten zich gedragen in een supportkennisbank als alle documenten positieve aanbevelingen bevatten, maar de gebruiker vraagt wat zeker niet gedaan moet worden?
Hoe specifiek VAD toe te passen om kwaliteitsmonsters te verkrijgen?
Hoe wordt gestructureerde output geïmplementeerd als beperkte decoding?