Sobes.tech
Middle — Senior

Ինչպես պատրաստել նախընտրությունների տվյալների հավաքածու DPO-ի համար։

sobes.tech AI

Պատասխան AI-ից

DPO (ուղիղ նախապատվության օպտիմալացում) համար նախապատվությունների տվյալների հավաքածու պատրաստելու համար կարևոր է հավաքել տվյալների զույգեր, որտեղ մեկը մյուսից հստակ նախընտրելի է:

Հիմնական քայլեր՝

  1. Նախապատվությունների տվյալների հավաքում: Օրինակ, օգտվողը ընտրում է մի պատասխան մի քանի պատասխաններից կամ փորձագետը գնահատում է տարբերակները:
  2. Ֆորմատավորում: Յուրաքանչյուր գրառում պետք է պարունակի երկու տարբերակներ (A և B) և նշան, որը ցույց է տալիս, որ A-ն նախընտրելի է B-ից:
  3. Համամասնություն: Խորհուրդ է տրվում, որ տվյալները լինեն բազմազան և հավասարակշռված թեմաներով և ոճերով:
  4. Անձեռնմխելիություն: Հեռացնել անորոշ կամ հակասական զույգերը:
  5. Տեքստերի տոքենիզացիա և մոդելի համար պատրաստում: Տեքստերը վերածել համապատասխան ձևաչափի:

Նմուշ գրառում՝

{
  "prompt": "Հարց կամ կոնտեքստ",
  "chosen": "Նախընտրած պատասխան",
  "rejected": "Ավելի քիչ նախընտրած պատասխան"
}

Այս տվյալների հավաքածուն թույլ է տալիս մոդելին սովորել ընտրել լավագույն պատասխանները նախապատվությունների հիման վրա։