Sobes.tech
Middle

Ar galima įvesti tekstą į BERT be išankstinio apdorojimo?

sobes.tech AI

Atsakymas iš AI

Negalima pateikti žaliavos teksto į BERT be išankstinio apdorojimo. BERT modelis reikalauja, kad įvesties duomenys būtų paversti skaitmeniniais tokenais naudojant specialųjį tokenizatorių, kuris skaidina tekstą į pogrupius (WordPiece) ir juos susieja su žodyno indeksais.

Išankstinis apdorojimas apima:

  • Teksto tokenizavimą
  • Specialiųjų tokenų pridėjimą ([CLS], [SEP])
  • Tokenų paversti į indeksus
  • Dėmesio kaukių kūrimą

Be šių žingsnių modelis negalės teisingai interpretuoti įvesties, nes jis būtent tokiuose skaitmeniniuose vaizdavimuose buvo apmokytas.

Pavyzdys naudojant HuggingFace Transformers:

from transformers import BertTokenizer

tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
text = "Hello, world!"
inputs = tokenizer(text, return_tensors='pt')

Čia inputs jau yra skaitmeniniai tensorai, kuriuos galima pateikti modeliui.