Sobes.tech
Middle — Senior

რა მეტრიკები გამოიყენება დიალოგების შეფასებისთვის (BLEU, perplexity, ადამიანის შეფასება)?

sobes.tech AI

პასუხი AI-სგან

BLEU (ორენოვანი შეფასება) — ავტომატური მეტрика, თავდაპირველად შექმნილი მანქანური თარგმნის ხარისხის შეფასებისთვის. ის შედარებს n-გრამებს რეფერენციულ პასუხთან და ზომავს მსგავსებას. დიალოგებში BLEU ეხმარება შეფასებაში, რამდენად ახლოს არის გენერირებული პასუხი მოსალოდნასთან, მაგრამ არ იღებს გათვალისწინებას კონტექსტს და პასუხების მრავალფეროვნებას.

Perplexity — მეტრიკაა, რომელიც აჩვენებს, რამდენად კარგად პროგნოზირებს ენის მოდელი სიტყვების სერიას. რაც დაბალია perplexity, მით უკეთესი მოდელი პროგნოზირებს ტექსტს. დიალოგებში, perplexity ასახავს მოდელის შესაძლებლობას, შექმნას სავარაუდო და ბუნებრივი პასუხები.

ადამიანის შეფასება — სუბიექტური შეფასება დიალოგების ხარისხის, სადაც ექსპერტები ან მომხმარებლები აფასებენ პასუხებს შესაბამისობის, ინფორმატიულობის, ბუნებრივობის და თანმიმდევრულობის კრიტერიუმებით. ეს ყველაზე სანდო მეთოდია, რადგან ავტომატური მეტრიკები არ ყოველთვის ასახავს დიალოგის ხარისხს ადამიანის თვალსაზრისით.