Sobes.tech
Junior — Middle

Wat is POS-tagging? Welke modellen zijn historisch gebruikt?

sobes.tech AI

Antwoord van AI

POS-tagging (Part-Of-Speech tagging) is het proces van het automatisch bepalen van de woordsoort (zelfstandig naamwoord, werkwoord, bijvoeglijk naamwoord, enz.) voor elk woord in een tekst.

Historisch gezien werden de volgende modellen gebruikt voor POS-tagging:

  • Regels gebaseerd op woordenboeken en grammaticale regels — handmatig regels maken om woordsoorten te bepalen.
  • Statistische modellen — bijvoorbeeld verborgen Markov-modellen (HMM), die overgangswaarschijnlijkheden tussen tags gebruiken.
  • Modellen gebaseerd op voorwaardelijke willekeurige velden (CRF) — flexibelere modellen die rekening houden met de context.
  • Neurale netwerken — moderne benaderingen met gebruik van recurrente neurale netwerken (RNN), LSTM en transformers, die hoge nauwkeurigheid bieden.

Voorbeeld van eenvoudige POS-tagging met de NLTK-bibliotheek in Python:

import nltk
nltk.download('averaged_perceptron_tagger')

tekst = "I am learning POS tagging."
tokens = nltk.word_tokenize(tekst)
tags = nltk.pos_tag(tokens)
print(tags)

Resultaat — een lijst van tuples (woord, woordsoortetiket).