Sobes.tech
Middle

Kun je tekst aan BERT leveren zonder voorbewerking?

sobes.tech AI

Antwoord van AI

Het is niet mogelijk om ruwe tekst zonder preprocessing aan BERT te voeren. Het BERT-model vereist dat de invoergegevens worden omgezet in numerieke tokens met behulp van een speciale tokenizer, die de tekst opsplitst in subwoorden (WordPiece) en deze koppelt aan indices uit het woordenboek.

Preprocessing omvat:

  • Tekst tokeniseren
  • Toevoegen van speciale tokens ([CLS], [SEP])
  • Omzetten van tokens naar indices
  • Aanmaken van aandachtmaskers

Zonder deze stappen kan het model de invoer niet correct interpreteren, omdat het precies op deze numerieke representaties is getraind.

Voorbeeld met HuggingFace Transformers:

from transformers import BertTokenizer

tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
text = "Hello, world!"
inputs = tokenizer(text, return_tensors='pt')

Hier zijn inputs al numerieke tensors die aan het model kunnen worden gevoerd.