Sobes.tech
Middle — Senior

Кои метрики се използват за оценка на диалозите (BLEU, perplexity, човешка оценка)?

sobes.tech AI

Отговор от AI

BLEU (Билингвална оценка) — автоматична метрика, първоначално разработена за оценка на качеството на машинния превод. Тя сравнява n-грами с референтния отговор и измерва сходството. В диалозите BLEU помага да се оцени колко близо е генерираният отговор до очаквания, но не взема предвид контекста и разнообразието на отговорите.

Perplexity — метрика, която показва колко добре езиков модел предсказва последователност от думи. Колкото по-ниска е perplexity, толкова по-добре моделът предсказва текста. В диалозите perplexity отразява способността на модела да генерира вероятни и естествени отговори.

Оценка от човек — субективна оценка на качеството на диалозите, при която експерти или потребители оценяват отговорите според критерии като релевантност, информативност, естественост и последователност. Това е най-надеждният метод за оценка, тъй като автоматичните метрики не винаги отразяват качеството на диалога от човешка гледна точка.