Middle+
Text-to-SQL агентінің сапасы қалай бағаланды?
sobes.tech AI
AI-дан жауап
Text-to-SQL агентінің сапасы әдетте бірнеше негізгі көрсеткіштер бойынша бағаланады:
- Дәлдік (Accuracy): жасалған SQL сұрауы күтілген (сілтеме) сұрауға қаншалықты сәйкес келеді. Әдетте, толық сәйкестік — эталонмен толық сәйкестік пайдаланылады.
- Іске асыру дәлдігі: жасалған сұрауды дерекқорда орындағанда ол эталонмен бірдей нәтиже беретінін тексеру.
- BLEU немесе басқа мәтін ұқсастық метрикалары: лексикалық ұқсастықты бағалау үшін қолданылады, дегенмен олар SQL үшін аз ақпаратты.
Бағалау үшін әдетте тест жиынтығы (табиғи тіл, эталон SQL) пайдаланылады, сұраулар жасалып, эталонмен салыстырылады. Сонымен қатар, жасалған SQL-дің синтаксистік дұрыстығы мен қауіпсіздігін тексеру маңызды.
Мысал ретінде: егер сұрақ "Барлық 30 жастан асқан пайдаланушыларды көрсетіңіз" болса, эталон SQL — SELECT * FROM users WHERE age > 30;. Егер агент дәл сондай сұрауды жасаса, ол сәтті деп саналады.
Кейде қателерді ручной талдау жүргізіледі және модельдің тұрақтылығын бағалау үшін әртүрлі сұрау түрлерінде тестілеу жүргізіледі.