Middle
Lehet-e szöveget beadni a BERT-be előfeldolgozás nélkül?
sobes.tech MI
Válasz az MI-től
Nem lehet nyers szöveget bemutatni a BERT-nek előfeldolgozás nélkül. A BERT modell megköveteli, hogy a bemeneti adatokat speciális tokenizáló segítségével numerikus tokenekké alakítsuk, amely felbontja a szöveget al- szavakra (WordPiece) és hozzárendeli őket a szótár indexeihez.
Az előfeldolgozás magában foglalja:
- A szöveg tokenizálását
- Különleges tokenek hozzáadása ([CLS], [SEP])
- A tokenek indexekké alakítása
- Figyelemmaszkok létrehozása
Ezek nélkül a lépések nélkül a modell nem fogja tudni helyesen értelmezni a bemenetet, mivel pontosan ezeken a numerikus reprezentációkon tanult.
Példa HuggingFace Transformers használatával:
from transformers import BertTokenizer
tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
text = "Hello, world!"
inputs = tokenizer(text, return_tensors='pt')
Itt az inputs már numerikus tensorok, amelyeket a modellbe lehet adni.