Sobes.tech
Middle

Lehet-e szöveget beadni a BERT-be előfeldolgozás nélkül?

sobes.tech MI

Válasz az MI-től

Nem lehet nyers szöveget bemutatni a BERT-nek előfeldolgozás nélkül. A BERT modell megköveteli, hogy a bemeneti adatokat speciális tokenizáló segítségével numerikus tokenekké alakítsuk, amely felbontja a szöveget al- szavakra (WordPiece) és hozzárendeli őket a szótár indexeihez.

Az előfeldolgozás magában foglalja:

  • A szöveg tokenizálását
  • Különleges tokenek hozzáadása ([CLS], [SEP])
  • A tokenek indexekké alakítása
  • Figyelemmaszkok létrehozása

Ezek nélkül a lépések nélkül a modell nem fogja tudni helyesen értelmezni a bemenetet, mivel pontosan ezeken a numerikus reprezentációkon tanult.

Példa HuggingFace Transformers használatával:

from transformers import BertTokenizer

tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
text = "Hello, world!"
inputs = tokenizer(text, return_tensors='pt')

Itt az inputs már numerikus tensorok, amelyeket a modellbe lehet adni.