Sobes.tech
Junior — Middle

Mis on Unigram keelemudel tokeniseerimisel (nagu SentencePiece)?

sobes.tech AI

Vastus AI-lt

Unigram keelemudel tokeniseerimisel, näiteks SentencePiece'is, on statistiline mudel, mis käsitleb teksti sõltumatute tokenite (algsõnade) jada, igaühel oma tõenäosus.

Peamine idee:

  • Mudel eeldab, et iga token jadas valitakse sõltumatult kindla tõenäosusega (unigram — homogeenne mudel).
  • SentencePiece treenib sõnastiku, optimeerides algsõnade kogumi, et maksimeerida treeningkorpuse tõenäosust.
  • Tokeniseerimise ajal jaguneb tekst sõnastikus olevate tokenite jadasse, mis maksimeerib kogu tõenäosuse vastavalt mudelile.

Eelised:

  • Võimaldab automaatselt valida optimaalse algsõnade kogumi ilma käsitsi sõnastikku määramata.
  • Toimib hästi erinevate keelte ja tundmatute sõnadega.

Näide: sõna "unbelievable" puhul võib mudel jagada selle tokeniteks "un", "believ", "able" ning valida kõige tõenäolisema jaotuse.