Dialoglarni baholash uchun qanday mezonlar ishlatiladi (BLEU, perplexity, inson bahosi)?
sobes.tech AI
AIdan javob
BLEU (Ikki tillilik baholash) — avtomatik o‘lchov bo‘lib, dastlab mashina tarjimasining sifatini baholash uchun ishlab chiqilgan. U n-gramlarni referens javob bilan solishtiradi va o‘xshashlikni o‘lchaydi. Dialoglarda BLEU ishlab chiqarilgan javobning kutilgan javobga qanchalik yaqinligini baholashga yordam beradi, ammo kontekst va javoblarning xilma-xilligini hisobga olmaydi.
Perpleksity — bu til modelining so‘zlar ketma-ketligini qanchalik yaxshi bashorat qilayotganini ko‘rsatadigan o‘lchov. Perpleksite pastroq bo‘lsa, model matnni yaxshiroq bashorat qiladi. Dialoglarda, perpleksite modelning ehtimoliy va tabiiy javoblar yaratish qobiliyatini aks ettiradi.
Inson baholash — dialoglarning sifatini subyektiv baholash bo‘lib, mutaxassislar yoki foydalanuvchilar javoblarni muhimligi, ma'lumot berishi, tabiiyligi va izchilligi kabi mezonlar bo‘yicha baholashadi. Bu avtomatik o‘lchovlar har doim dialogning inson nuqtai nazaridan sifatini aks ettirmasligi sababli eng ishonchli baholash usulidir.