Sobes.tech
Middle — Senior

Hogyan készítsünk preferencia adatgyűjteményt a DPO-hoz?

sobes.tech MI

Válasz az MI-től

A DPO (Közvetlen Preferencia Optimalizálás) számára előnyadatok (preference dataset) készítésekor fontos összegyűjteni olyan adatpárokat, ahol az egyik alternatíva egyértelműen előnyösebb a másiknál.

Fő lépések:

  1. Preferencia adatok gyűjtése: Például, a felhasználó több válasz közül választ, vagy szakértő értékeli az opciókat.
  2. Formázás: Minden rekordnak tartalmaznia kell egy pár opciót (A és B), és egy címkét, ami jelzi, hogy A előnyösebb B-nél.
  3. Egyensúlyozás: Ajánlott, hogy az adatok változatosak és kiegyensúlyozottak legyenek témák és stílusok szerint.
  4. Tisztítás: Kétes vagy ellentmondó párok eltávolítása.
  5. Tokenizálás és modellhez való előkészítés: A szövegek átalakítása a tanuláshoz megfelelő formátumba.

Példa rekord:

{
  "prompt": "Kérdés vagy kontextus",
  "chosen": "Előnyben részesített válasz",
  "rejected": "Kevésbé preferált válasz"
}

Ez az adathalmaz lehetővé teszi a modell számára, hogy megtanulja kiválasztani a legjobb válaszokat a preferenciák alapján.