Quais métricas de avaliação de diálogos (BLEU, perplexidade, avaliação humana)?
sobes.tech IA
Resposta da IA
BLEU (Avaliação Bilingue de Substituição) — uma métrica automática, inicialmente desenvolvida para avaliar a qualidade da tradução automática. Compara n-gramas com a resposta de referência, medindo a semelhança. Em diálogos, o BLEU ajuda a avaliar o quão próximo a resposta gerada está da esperada, mas não leva em conta o contexto nem a diversidade de respostas.
Perplexidade — uma métrica que mostra o quão bem um modelo de linguagem prevê uma sequência de palavras. Quanto menor a perplexidade, melhor o modelo prevê o texto. Em diálogos, a perplexidade reflete a capacidade do modelo de gerar respostas prováveis e naturais.
Avaliação humana — uma avaliação subjetiva da qualidade dos diálogos, onde especialistas ou usuários avaliam as respostas com base em critérios como relevância, informatividade, naturalidade e coerência. É a forma mais confiável de avaliação, pois métricas automáticas nem sempre refletem a qualidade do diálogo do ponto de vista humano.