Sobes.tech
Middle — Senior

Ի՞նչ մեթոդներ են օգտագործվում զրույցների գնահատման համար (BLEU, perplexity, մարդական գնահատում):

sobes.tech AI

Պատասխան AI-ից

BLEU (Երկլեզվյա գնահատում) — ավտոմատ չափանիշ, սկզբնապես մշակված մեքենայական թարգմանության որակը գնահատելու համար։ Այն համեմատում է n-գրամները ռեֆերանսային պատասխանով և չափում է նմանությունը։ Դիալոգներում BLEU-ն օգնում է գնահատել, թե որքան մոտ է ստեղծված պատասխանն սպասվածին, բայց չի հաշվի առնում կոնտեքստը և պատասխանների բազմազանությունը։

Perplexity — մի չափանիշ, որը ցույց է տալիս, թե որքան լավ է լեզվական մոդելը կանխատեսում բառերի հաջորդականությունը։ Որքան ավելի ցածր է perplexity-ն, այնքան ավելի լավ է մոդելը կանխատեսում տեքստը։ Դիալոգներում, perplexity-ն արտացոլում է մոդելի կարողությունը ստեղծել հավանական և բնական պատասխաններ։

Մարդկային գնահատում — սուբյեկտիվ գնահատում է դիալոգների որակը, որտեղ փորձագետներն կամ օգտվողները գնահատում են պատասխանները համապատասխանության, տեղեկատվականության, բնականության և համահունչության չափանիշներով։ Սա ամենահավատարիմ գնահատման մեթոդն է, քանի որ ավտոմատ չափանիշները միշտ չէ, որ արտացոլում են դիալոգի որակը մարդու տեսանկյունից։