Junior — Middle
Čo je model jazyka Unigram v tokenizácii (ako v SentencePiece)?
sobes.tech AI
Odpoveď od AI
Model jazyka unigram pri tokenizácii, napríklad v SentencePiece, je štatistický model, ktorý považuje text za sekvenciu nezávislých tokenov (podslov), z ktorých každý má svoju vlastnú pravdepodobnosť.
Hlavná myšlienka:
- Model predpokladá, že každý token v sekvencii je vybraný nezávisle s určitou pravdepodobnosťou (unigram — homogénny model).
- SentencePiece trénuje slovník tokenov, optimalizáciou sady podslov tak, aby maximalizoval pravdepodobnosť tréningového korpusu.
- Pri tokenizácii je text rozdelený na sekvenciu tokenov zo slovníka, ktorá maximalizuje celkovú pravdepodobnosť podľa modelu.
Výhody:
- Umožňuje automaticky vybrať optimálnu sadu podslov bez nutnosti ručne definovať slovník.
- Dobre funguje s rôznymi jazykmi a neznámymi slovami.
Príklad: pre slovo "unbelievable" môže model rozdeliť na tokeny "un", "believ", "able" s odpovedajúcimi pravdepodobnosťami, vyberajúc najpravdepodobnejšie rozdelenie.