Aké metriky sa používajú na hodnotenie dialógov (BLEU, perplexity, ľudské hodnotenie)?
sobes.tech AI
Odpoveď od AI
BLEU (Dvojjazyčné hodnotenie náhradníkov) — automatická metrika, pôvodne vyvinutá na hodnotenie kvality strojového prekladu. Porovnáva n-gramy s referenčnou odpoveďou a meria podobnosť. V dialógoch pomáha BLEU hodnotiť, ako veľmi je generovaná odpoveď blízka očakávanej, ale nezohľadňuje kontext a rozmanitosť odpovedí.
Perplexita — metrika ukazujúca, ako dobre jazykový model predpovedá sekvenciu slov. Čím nižšia je perplexita, tým lepšie model predpovedá text. V dialógoch odráža perplexita schopnosť modelu generovať pravdepodobné a prirodzené odpovede.
Hodnotenie človekom — subjektívne hodnotenie kvality dialógov, pri ktorom experti alebo používatelia hodnotia odpovede podľa kritérií ako relevantnosť, informatívnosť, prirodzenosť a koherencia. Je to najspoľahlivejšia metóda hodnotenia, pretože automatické metriky nemusia vždy odrážať kvalitu dialógu z pohľadu človeka.