Sobes.tech
Middle

შეგიძლია ტექსტი BERT-ში წინასწარი დამუშავების გარეშე ჩააგდე?

sobes.tech AI

პასუხი AI-სგან

BERT-სთვის ნედლ ტექსტს წინასწარი დამუშავების გარეშე ვერ მიაწოდებთ. BERT მოდელი მოითხოვს, რომ შესავალი მონაცემები გარდაიქმნას რიცხვობრივ ტოკენებად სპეციალური ტოკენიზატორის დახმარებით, რომელიც ნაწილებს (WordPiece) ყოფს ტექსტს და მათ შესაბამისობას უწევს ლექსიკონის ინდექსებთან.

წინასწარი დამუშავება მოიცავს:

  • ტექსტის ტოკენიზაციას
  • სპეციალური ტოკენების დამატებას ([CLS], [SEP])
  • ტოკენების გარდაქმნას ინდექსებად
  • ყურადღების მასკების შექმნას

ამ ნაბიჯების გარეშე, მოდელი ვერ შეძლებს სწორად ინტერპრეტაციას, რადგან ის სწორედ ამ რიცხვობრივ წარმოდგენებზეა გაწვრთნილი.

მაგალითი HuggingFace Transformers-ის გამოყენებით:

from transformers import BertTokenizer

tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
text = "Hello, world!"
inputs = tokenizer(text, return_tensors='pt')

აქ, inputs უკვე რიცხვობრივი ტენზორებია, რომლებიც შეიძლება მიეცეს მოდელს.