Middle — Senior
Hogyan készítsünk preferencia adatgyűjteményt a DPO-hoz?
sobes.tech MI
Válasz az MI-től
A DPO (Közvetlen Preferencia Optimalizálás) számára előnyadatok (preference dataset) készítésekor fontos összegyűjteni olyan adatpárokat, ahol az egyik alternatíva egyértelműen előnyösebb a másiknál.
Fő lépések:
- Preferencia adatok gyűjtése: Például, a felhasználó több válasz közül választ, vagy szakértő értékeli az opciókat.
- Formázás: Minden rekordnak tartalmaznia kell egy pár opciót (A és B), és egy címkét, ami jelzi, hogy A előnyösebb B-nél.
- Egyensúlyozás: Ajánlott, hogy az adatok változatosak és kiegyensúlyozottak legyenek témák és stílusok szerint.
- Tisztítás: Kétes vagy ellentmondó párok eltávolítása.
- Tokenizálás és modellhez való előkészítés: A szövegek átalakítása a tanuláshoz megfelelő formátumba.
Példa rekord:
{
"prompt": "Kérdés vagy kontextus",
"chosen": "Előnyben részesített válasz",
"rejected": "Kevésbé preferált válasz"
}
Ez az adathalmaz lehetővé teszi a modell számára, hogy megtanulja kiválasztani a legjobb válaszokat a preferenciák alapján.