Sobes.tech
Middle — Senior

Milyen metrikákat használnak a párbeszédek értékelésére (BLEU, perplexity, emberi értékelés)?

sobes.tech MI

Válasz az MI-től

BLEU (Kétnyelvű Értékelés) — egy automatikus mérőszám, amely eredetileg a gépi fordítás minőségének értékelésére lett kifejlesztve. N-gramokat összehasonlít a referencia válasszal, és mérni a hasonlóságot. Dialógusokban a BLEU segít értékelni, hogy mennyire közel áll a generált válasz a várthoz, de nem veszi figyelembe a kontextust és a válaszok sokféleségét.

Perplexitás — egy mérőszám, ami megmutatja, mennyire jól jósolja meg egy nyelvi modell a szavak sorozatát. Minél alacsonyabb a perplexitás, annál jobb a modell előrejelzése a szövegre. Dialógusokban a perplexitás tükrözi a modell képességét, hogy valószínű és természetes válaszokat generáljon.

Emberi értékelés — szubjektív értékelés a dialógusok minőségéről, ahol szakértők vagy felhasználók értékelik a válaszokat relevancia, informatív tartalom, természetesség és koherencia szerint. Ez a legmegbízhatóbb értékelési módszer, mivel az automatikus mérőszámok nem mindig tükrözik a dialógus minőségét emberi szempontból.