Sobes.tech
Middle — Senior

Kas yra decision transformer ir kaip jis paverčia RL į stebimąjį mokymąsi?

sobes.tech AI

Atsakymas iš AI

Decision Transformer yra požiūris į Reinforcement Learning (RL), kuris formuluoja agento mokymosi užduotį kaip supervisuoto mokymosi problemą. Vietoj to, kad mokytųsi per sąveiką su aplinka ir politikos atnaujinimą remiantis apdovanojimais, Decision Transformer mokomas naudojant istorinius duomenis (trajektorijas) su transformatoriaus architektūra.

Pagrindinė idėja:

  • Modelio įėjimas yra sekos būsenų, veiksmų ir tikslinių apdovanojimų (return-to-go).
  • Modelis išmoksta prognozuoti kitą veiksmą, atsižvelgiant į norimą apdovanojimo lygį.

Taip, RL užduotis sumažinama iki kitų veiksmų prognozavimo pagal ankstesnius, leidžiant naudoti supervisuoto mokymosi metodus, mokant transformatorių iš anksto surinktų duomenų be interaktyvaus mokymosi.

Tai leidžia:

  • naudoti didelius duomenų rinkinius be internetinės sąveikos,
  • mokyti modelius, gebančius bendrinti ir planuoti.

Apytiksliai, Decision Transformer priima kaip įėjimą:

(states, actions, returns_to_go) -> next_action

ir mokomas sumažinti veiksmo prognozavimo klaidą.