Ինչպես է աշխատում տոքենիզացիան: Ինչու են օգտագործում ենթասպասարկման տոքեններ ամբողջ բառերի փոխարեն։
Machine Learning / AI
Պատմեք BGE-M3-ի մասին՝ երեք ներկայացումներով՝ խիտ, նոսր, բազմա-վեկտոր։
Ի՞նչ են Recall և Precision-ը: Պատկերացրեք՝ 50 մրգ, 30 խնձոր և 20 գազար, ռոբոտը ճիշտ գտել է 20 խնձոր, բայց 15 գազար ճանաչել է որպես խնձոր: Հաշվեք մետաղները։
Դու գիտե՞ք LoRA-ն և fine-tuning մեթոդները։
Ինչպես ընտրվեցին համակցված որոնման համար գործակիցները։
Ինչու՞ ձեզ անհրաժեշտ էր 12,000 հարց-պատասխան զույգ, եթե ընդամենը 15 ձևանմուշներ էին:
Ինչու եք ճանաչել փաստաթղթերը որպես պատկերներ, փոխարենը ստեղծելու պարսկեր?
Ինչպե՞ս կազմեցիք փորձնական տվյալների հավաքածուն՝ նույն 12 հազար զույգերից թե նոր տվյալներից։
Կլաստերացման մասին պատմեք. ինչ խնդիր լուծեցիք, ինչ մեթոդ օգտագործեցիք, ինչպես չափեցիք որակը։
Ինչպես է աշխատում տրանսֆորմատորը: Պատմեք ինձ BERT և GPT մասին։
Ի՞նչ է խիտ վեկտորը (dense embedding): Ինչպե՞ս է ստացվում: Ի՞նչ չափի է:
Ի՞նչ մոդելներ են օգտագործվել յուրաքանչյուր փուլում: Օգտագործվել է առարկաների հանման, վեկտորիզացիայի, կամ գեներացման համար։
Ինչպե՞ս եք գնահատել RAG համակարգի որակը: Որ մեթոդները եք օգտագործել:
Ի՞նչ է cross-encoder-ը և որտեղ եք դուք այն օգտագործել:
Ինչու է անհրաժեշտ նվազեցնել բառարանի չափը: Ինչու է մեծ բառարանը վատ: Որ ֆունկցիայում է տեղի ունենում բեռը:
Ի՞նչ էր ուղարկվում ձեր համակարգում վերջնական օգտվողին։
Ի՞նչ է sparse վեկտորը: Ինչպե՞ս է այն տարբերվում dense-ից։
Ի՞նչ է GET և POST հարցումների տարբերությունը։
Պատմեք պարզ բառերով, ինչպես է աշխատում ձեր համակարգը մեկ օգտվողի համար, առանց ասինխրոնության.
Մի հարցի համար հարմար է 12 հազար պատասխաններից մեկը կամ շատերը: