Junior — Middle
Mi az a Unigram nyelvi modell a tokenizációban (például SentencePiece)?
sobes.tech MI
Válasz az MI-től
A unigram nyelvi modell tokenizációban, például SentencePiece-ben, egy statisztikai modell, amely a szöveget független tokenek (al szavak) sorozataként kezeli, mindegyik saját valószínűséggel.
Fő ötlet:
- A modell feltételezi, hogy minden token a sorozatban függetlenül van kiválasztva egy meghatározott valószínűséggel (unigram — homogén modell).
- A SentencePiece egy token szótárt tanít, optimalizálva az al szavak halmazát, hogy maximalizálja a tanító korpusz valószínűségét.
- Tokenizáláskor a szöveget a szótárból származó tokenek sorozatára bontja, amely maximalizálja a modell szerint az össz valószínűséget.
Előnyök:
- Automatikusan kiválasztható az optimális al szavak halmaza anélkül, hogy kézzel kellene szótárt definiálni.
- Jól működik különböző nyelvekkel és ismeretlen szavakkal.
Példa: az "unbelievable" szó esetében a modell feloszthatja "un", "believ", "able" tokenekre, a legvalószínűbb felbontást választva.