Middle
შეგიძლია ტექსტი BERT-ში წინასწარი დამუშავების გარეშე ჩააგდე?
sobes.tech AI
პასუხი AI-სგან
BERT-სთვის ნედლ ტექსტს წინასწარი დამუშავების გარეშე ვერ მიაწოდებთ. BERT მოდელი მოითხოვს, რომ შესავალი მონაცემები გარდაიქმნას რიცხვობრივ ტოკენებად სპეციალური ტოკენიზატორის დახმარებით, რომელიც ნაწილებს (WordPiece) ყოფს ტექსტს და მათ შესაბამისობას უწევს ლექსიკონის ინდექსებთან.
წინასწარი დამუშავება მოიცავს:
- ტექსტის ტოკენიზაციას
- სპეციალური ტოკენების დამატებას ([CLS], [SEP])
- ტოკენების გარდაქმნას ინდექსებად
- ყურადღების მასკების შექმნას
ამ ნაბიჯების გარეშე, მოდელი ვერ შეძლებს სწორად ინტერპრეტაციას, რადგან ის სწორედ ამ რიცხვობრივ წარმოდგენებზეა გაწვრთნილი.
მაგალითი HuggingFace Transformers-ის გამოყენებით:
from transformers import BertTokenizer
tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
text = "Hello, world!"
inputs = tokenizer(text, return_tensors='pt')
აქ, inputs უკვე რიცხვობრივი ტენზორებია, რომლებიც შეიძლება მიეცეს მოდელს.