Middle — Senior
Ինչպես պատրաստել նախընտրությունների տվյալների հավաքածու DPO-ի համար։
sobes.tech AI
Պատասխան AI-ից
DPO (ուղիղ նախապատվության օպտիմալացում) համար նախապատվությունների տվյալների հավաքածու պատրաստելու համար կարևոր է հավաքել տվյալների զույգեր, որտեղ մեկը մյուսից հստակ նախընտրելի է:
Հիմնական քայլեր՝
- Նախապատվությունների տվյալների հավաքում: Օրինակ, օգտվողը ընտրում է մի պատասխան մի քանի պատասխաններից կամ փորձագետը գնահատում է տարբերակները:
- Ֆորմատավորում: Յուրաքանչյուր գրառում պետք է պարունակի երկու տարբերակներ (A և B) և նշան, որը ցույց է տալիս, որ A-ն նախընտրելի է B-ից:
- Համամասնություն: Խորհուրդ է տրվում, որ տվյալները լինեն բազմազան և հավասարակշռված թեմաներով և ոճերով:
- Անձեռնմխելիություն: Հեռացնել անորոշ կամ հակասական զույգերը:
- Տեքստերի տոքենիզացիա և մոդելի համար պատրաստում: Տեքստերը վերածել համապատասխան ձևաչափի:
Նմուշ գրառում՝
{
"prompt": "Հարց կամ կոնտեքստ",
"chosen": "Նախընտրած պատասխան",
"rejected": "Ավելի քիչ նախընտրած պատասխան"
}
Այս տվյալների հավաքածուն թույլ է տալիս մոդելին սովորել ընտրել լավագույն պատասխանները նախապատվությունների հիման վրա։