Middle
Kun je tekst aan BERT leveren zonder voorbewerking?
sobes.tech AI
Antwoord van AI
Het is niet mogelijk om ruwe tekst zonder preprocessing aan BERT te voeren. Het BERT-model vereist dat de invoergegevens worden omgezet in numerieke tokens met behulp van een speciale tokenizer, die de tekst opsplitst in subwoorden (WordPiece) en deze koppelt aan indices uit het woordenboek.
Preprocessing omvat:
- Tekst tokeniseren
- Toevoegen van speciale tokens ([CLS], [SEP])
- Omzetten van tokens naar indices
- Aanmaken van aandachtmaskers
Zonder deze stappen kan het model de invoer niet correct interpreteren, omdat het precies op deze numerieke representaties is getraind.
Voorbeeld met HuggingFace Transformers:
from transformers import BertTokenizer
tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
text = "Hello, world!"
inputs = tokenizer(text, return_tensors='pt')
Hier zijn inputs al numerieke tensors die aan het model kunnen worden gevoerd.