Sobes.tech
Junior — Middle

Wat is een Unigram-taalmodel in tokenisatie (zoals in SentencePiece)?

sobes.tech AI

Antwoord van AI

Het unigram-taalmodel bij tokenisatie, bijvoorbeeld in SentencePiece, is een statistisch model dat de tekst beschouwt als een reeks onafhankelijke tokens (subwoorden), elk met zijn eigen waarschijnlijkheid.

Belangrijkste idee:

  • Het model gaat ervan uit dat elke token in de reeks onafhankelijk wordt gekozen met een bepaalde waarschijnlijkheid (unigram — homogeen model).
  • SentencePiece traint een woordenboek van tokens, waarbij het de set subwoorden optimaliseert om de waarschijnlijkheid van het trainingscorpus te maximaliseren.
  • Bij tokenisatie wordt de tekst verdeeld in een reeks tokens uit het woordenboek die de totale waarschijnlijkheid volgens het model maximaliseert.

Voordelen:

  • Maakt het mogelijk om automatisch de optimale set subwoorden te kiezen zonder handmatig een woordenboek te hoeven definiëren.
  • Werkt goed met verschillende talen en onbekende woorden.

Voorbeeld: voor het woord "unbelievable" kan het model het splitsen in tokens "un", "believ", "able" met bijbehorende waarschijnlijkheden, en de meest waarschijnlijke segmentatie kiezen.