Sobes.tech
Middle — Senior

Aký je rozdiel medzi algoritmami on-policy a off-policy?

sobes.tech AI

Odpoveď od AI

On-policy a off-policy sú dva prístupy v posilňovanom učení, ktoré sa líšia v stratégii (policy), ktorú používajú na učenie a zber dát.

  • On-policy algoritmy sa učia a hodnotia stratégiu, ktorá sa používa na výber akcií. To znamená, že agent sa učí zo skúseností získaných sledovaním aktuálnej stratégie. Príklad: algoritmus SARSA.

  • Off-policy algoritmy sa učia zo skúseností zozbieraných pomocou jednej stratégie, ale trénujú inú stratégiu. To umožňuje využívať údaje pochádzajúce od inej politiky alebo dokonca z histórie. Príklad: algoritmus Q-learning.

Napríklad, ak agent skúma prostredie pomocou stratégie ε-greedy, on-policy algoritmus bude aktualizovať hodnoty práve pre túto stratégiu, zatiaľ čo off-policy môže byť trénovaný na údajoch zozbieraných pomocou ε-greedy stratégie, ale bude aktualizovať hodnoty pre optimálnu (gready) stratégiu.

Hlavný rozdiel je v tom, či sa agent učí na základe údajov z rovnakej stratégie, ktorú zlepšuje (on-policy), alebo z inej stratégie (off-policy).