Ի՞նչ մեթոդներ են օգտագործվում զրույցների գնահատման համար (BLEU, perplexity, մարդական գնահատում):
sobes.tech AI
Պատասխան AI-ից
BLEU (Երկլեզվյա գնահատում) — ավտոմատ չափանիշ, սկզբնապես մշակված մեքենայական թարգմանության որակը գնահատելու համար։ Այն համեմատում է n-գրամները ռեֆերանսային պատասխանով և չափում է նմանությունը։ Դիալոգներում BLEU-ն օգնում է գնահատել, թե որքան մոտ է ստեղծված պատասխանն սպասվածին, բայց չի հաշվի առնում կոնտեքստը և պատասխանների բազմազանությունը։
Perplexity — մի չափանիշ, որը ցույց է տալիս, թե որքան լավ է լեզվական մոդելը կանխատեսում բառերի հաջորդականությունը։ Որքան ավելի ցածր է perplexity-ն, այնքան ավելի լավ է մոդելը կանխատեսում տեքստը։ Դիալոգներում, perplexity-ն արտացոլում է մոդելի կարողությունը ստեղծել հավանական և բնական պատասխաններ։
Մարդկային գնահատում — սուբյեկտիվ գնահատում է դիալոգների որակը, որտեղ փորձագետներն կամ օգտվողները գնահատում են պատասխանները համապատասխանության, տեղեկատվականության, բնականության և համահունչության չափանիշներով։ Սա ամենահավատարիմ գնահատման մեթոդն է, քանի որ ավտոմատ չափանիշները միշտ չէ, որ արտացոլում են դիալոգի որակը մարդու տեսանկյունից։