Middle
É possível submeter texto ao BERT sem pré-processamento?
sobes.tech IA
Resposta da IA
Não é possível fornecer texto bruto ao BERT sem pré-processamento. O modelo BERT exige que os dados de entrada sejam convertidos em tokens numéricos usando um tokenizador especial, que divide o texto em subpalavras (WordPiece) e os associa a índices do vocabulário.
O pré-processamento inclui:
- Tokenização do texto
- Adição de tokens especiais ([CLS], [SEP])
- Conversão de tokens em índices
- Criação de máscaras de atenção
Sem esses passos, o modelo não poderá interpretar corretamente a entrada, pois foi treinado exatamente com essas representações numéricas.
Exemplo usando HuggingFace Transformers:
from transformers import BertTokenizer
tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
text = "Hello, world!"
inputs = tokenizer(text, return_tensors='pt')
Aqui, inputs são tensores numéricos que podem ser fornecidos ao modelo.