Sobes.tech
Middle — Senior

Mesélj a tabuláris Q-tanulásról. Mikor nem működik már?

sobes.tech MI

Válasz az MI-től

A tabuláris Q-tanulás egy klasszikus megerősítéses tanulási algoritmus, amelyben a Q-függvény értékei táblázatban vannak tárolva. Minden cella egy (állapot, akció) párnak felel meg, és a várt jutalom becslését tartalmazza.

Az algoritmus a Q-értékeket a következő képlet szerint frissíti:

[ Q(s,a) \leftarrow Q(s,a) + \alpha \bigl(r + \gamma \max_{a'} Q(s',a') - Q(s,a)\bigr) ]

ahol:

  • (s) — aktuális állapot,
  • (a) — kiválasztott akció,
  • (r) — kapott jutalom,
  • (s') — következő állapot,
  • (\alpha) — tanulási ráta,
  • (\gamma) — diszkontálási tényező.

Mikor nem működik tovább a tabuláris Q-learning?

  • Nagy vagy folytonos állapot- és akciótér. A táblázat túl nagy vagy végtelen lesz, ami lehetetlenné teszi a tárolást és a frissítést.
  • Magas dimenziójú állapotok (dimenzionalitás átok). Az állapot- és akciópárok száma exponenciálisan nő, ami lassú tanuláshoz és nagy memóriaigényhez vezet.
  • Általánosítás hiánya. A táblás módszer nem képes általánosítani a tudást hasonló állapotok között, ellentétben az összefoglaló függvényekkel (pl. neurális hálózatok).

Ezekben az esetekben Q-függvény közelítőket (Deep Q-learning és mások) alkalmaznak, amelyek képesek dolgozni folytonos és magas dimenziós terekben.