Sobes.tech
Junior — Middle

O que é o modelo de linguagem Unigram na tokenização (como no SentencePiece)?

sobes.tech IA

Resposta da IA

O modelo de linguagem unigram na tokenização, por exemplo no SentencePiece, é um modelo estatístico que considera o texto como uma sequência de tokens independentes (subpalavras), cada um com sua própria probabilidade.

Ideia principal:

  • O modelo assume que cada token na sequência é escolhido independentemente com uma probabilidade determinada (unigram — modelo homogéneo).
  • SentencePiece treina um dicionário de tokens, otimizando o conjunto de subpalavras para maximizar a probabilidade do corpus de treinamento.
  • Ao tokenizar, o texto é dividido em uma sequência de tokens do dicionário que maximiza a probabilidade total de acordo com o modelo.

Vantagens:

  • Permite selecionar automaticamente o conjunto ótimo de subpalavras sem necessidade de definir manualmente um dicionário.
  • Funciona bem com diferentes idiomas e palavras desconhecidas.

Exemplo: para a palavra "unbelievable", o modelo pode dividi-la em tokens "un", "believ", "able" com probabilidades correspondentes, escolhendo a segmentação mais provável.