Sobes.tech
Junior — Middle

Čo je model jazyka Unigram v tokenizácii (ako v SentencePiece)?

sobes.tech AI

Odpoveď od AI

Model jazyka unigram pri tokenizácii, napríklad v SentencePiece, je štatistický model, ktorý považuje text za sekvenciu nezávislých tokenov (podslov), z ktorých každý má svoju vlastnú pravdepodobnosť.

Hlavná myšlienka:

  • Model predpokladá, že každý token v sekvencii je vybraný nezávisle s určitou pravdepodobnosťou (unigram — homogénny model).
  • SentencePiece trénuje slovník tokenov, optimalizáciou sady podslov tak, aby maximalizoval pravdepodobnosť tréningového korpusu.
  • Pri tokenizácii je text rozdelený na sekvenciu tokenov zo slovníka, ktorá maximalizuje celkovú pravdepodobnosť podľa modelu.

Výhody:

  • Umožňuje automaticky vybrať optimálnu sadu podslov bez nutnosti ručne definovať slovník.
  • Dobre funguje s rôznymi jazykmi a neznámymi slovami.

Príklad: pre slovo "unbelievable" môže model rozdeliť na tokeny "un", "believ", "able" s odpovedajúcimi pravdepodobnosťami, vyberajúc najpravdepodobnejšie rozdelenie.