Sobes.tech
Middle — Senior

Мақсади кланпошиши дар PPO чӣ аст?

sobes.tech AI

Ҷавоб аз AI

Мақсад боғланишӣ дар PPO (Proximal Policy Optimization) усули маҳдуд кардани навсозии сиёсати барои пешгирӣ кардани тағироти хеле калон аст, ки метавонанд омӯзишро бадтар кунанд. Дар назари классикии навсозии сиёсати, функсияи талафот асос ёфтааст ба нисбати эҳтимолиятҳои амалҳои нав ва кӯҳна (ratio).

Ҳикоя ин аст, ки ин нисбатро "боғ" (clip) дар дохили интервал [1 - ε, 1 + ε] бурем, ки ε як параметри хурд аст (масалан, 0.2). Ин пешгирӣ мекунад, ки вақте нисбат аз ин ҳудудҳо мегузарад, навсозии хеле қавӣ сурат гирад.

Формалӣ, функсияи талафот барои як қадам:

L^{CLIP}(	heta) = E_t [
  min(r_t(	heta) \, A_t, clip(r_t(	heta), 1 - \, \\epsilon, 1 + \, \\epsilon) \, A_t)
]

ки дар он:

  • r_t(θ) — нисбати эҳтимолиятҳои сиёсати нав ва кӯҳна барои амал дар вақти t,
  • A_t — тахминии манфиат.

Ин кафолат медиҳад, ки байни таҳқиқот ва устуворӣ дар омӯзиш мувозинат ҳосил мешавад, ва имкон медиҳад, ки сиёсати оптималӣ бо самаранокӣ ба даст ояд, бе ҷаҳишҳои ногаҳонӣ.

Бинобар ин, мақсади боғшуда кӯмак мекунад, ки PPO алгоритми бештар устувор ва боэътимод дар омӯзиши пурқувват бошад.