Sobes.tech
Middle

Peut-on soumettre du texte à BERT sans prétraitement?

sobes.tech IA

Réponse de l'IA

Il est impossible de fournir du texte brut à BERT sans prétraitement. Le modèle BERT nécessite que les données d'entrée soient converties en tokens numériques à l'aide d'un tokenizer spécial, qui divise le texte en sous-mots (WordPiece) et les associe à des indices du vocabulaire.

Le prétraitement comprend :

  • La tokenisation du texte
  • L'ajout de tokens spéciaux ([CLS], [SEP])
  • La conversion des tokens en indices
  • La création de masques d'attention

Sans ces étapes, le modèle ne pourra pas interpréter correctement l'entrée, car il a été entraîné précisément avec ces représentations numériques.

Exemple avec HuggingFace Transformers :

from transformers import BertTokenizer

tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
text = "Hello, world!"
inputs = tokenizer(text, return_tensors='pt')

Ici, inputs sont des tenseurs numériques pouvant être fournis au modèle.