Sobes.tech
Middle — Senior

Dialoqların qiymətləndirilməsi üçün hansı metriklər istifadə olunur (BLEU, perplexity, insan qiymətləndirməsi)?

sobes.tech Süni İntellekt

AI-dan cavab

BLEU (İki dilli qiymətləndirmə) — avtomatik ölçü, ilkin olaraq maşın tərcüməsinin keyfiyyətini qiymətləndirmək üçün hazırlanmışdır. O, n-gramları referens cavab ilə müqayisə edir və oxşarlığı ölçür. Dialoqlarda BLEU, yaradılan cavabın gözlənilənə nə qədər yaxın olduğunu qiymətləndirməyə kömək edir, lakin kontekst və cavabların müxtəlifliyini nəzərə almır.

Perplekslik — dil modelinin söz ardıcıllığını nə dərəcədə yaxşı proqnozlaşdırdığını göstərən ölçüdür. Perplekslik nə qədər aşağı olarsa, model mətni o qədər yaxşı proqnozlaşdırır. Dialoqlarda, perplekslik modelin ehtimal olunan və təbii cavablar yaratma qabiliyyətini əks etdirir.

İnsan qiymətləndirməsi — dialoqların keyfiyyətinin subyektiv qiymətləndirilməsi, burada mütəxəssislər və ya istifadəçilər cavabları uyğunluq, məlumatlılıq, təbii və ardıcıllıq kimi meyarlar əsasında qiymətləndirirlər. Bu, avtomatik ölçülər hər zaman dialoqun keyfiyyətini insan baxışından əks etdirmədiyi üçün ən etibarlı qiymətləndirmə üsuludur.