Middle
Peut-on soumettre du texte à BERT sans prétraitement?
sobes.tech IA
Réponse de l'IA
Il est impossible de fournir du texte brut à BERT sans prétraitement. Le modèle BERT nécessite que les données d'entrée soient converties en tokens numériques à l'aide d'un tokenizer spécial, qui divise le texte en sous-mots (WordPiece) et les associe à des indices du vocabulaire.
Le prétraitement comprend :
- La tokenisation du texte
- L'ajout de tokens spéciaux ([CLS], [SEP])
- La conversion des tokens en indices
- La création de masques d'attention
Sans ces étapes, le modèle ne pourra pas interpréter correctement l'entrée, car il a été entraîné précisément avec ces représentations numériques.
Exemple avec HuggingFace Transformers :
from transformers import BertTokenizer
tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
text = "Hello, world!"
inputs = tokenizer(text, return_tensors='pt')
Ici, inputs sont des tenseurs numériques pouvant être fournis au modèle.