Sobes.tech
Middle — Senior

Ի՞նչ է CQL-ը (Կոնսերվատիվ Q-ուսուցում):

sobes.tech AI

Պատասխան AI-ից

Կոնսերվատիվ Q-ուսուցում (CQL) — դա ուժեղ և հուսալի ուսուցման մեթոդ է, որը նպատակ ունի բարելավել offline ռեժիմում (offline RL) ուսուցման կայունությունը և հուսալիությունը։ Կլասիկ Q-ուսուցման ժամանակ, գործակալը սովորում է առավելագույնի հասցնել սպասվող պարգևը՝ թարմացնելով արժեքային ֆունկցիան (Q-ֆունկցիան) փորձի հիման վրա։ Սակայն, ֆիքսված տվյալների հավաքածուով ուսուցման ժամանակ (միջավայրի հետ փոխազդեցություն չլինելով), կլասիկ մեթոդները կարող են գերագնահատել գործողությունները, ինչը հանգեցնում է վատ քաղաքականությունների։

CQL լուծում է այս խնդիրը՝ ավելացնելով կորուստային ֆունկցիային պատժամիջոց այն գործողությունների համար, որոնք չեն ներկայացված ուսուցման հավաքածուում։ Սա դարձնում է մոդելը ավելի պահպանողական, նվազեցնում է Q-արժեքները անորոշ կամ հազվագյուտ գործողությունների համար և այդպիսով նվազեցնում է վատ ռազմավարություններ ընտրելու ռիսկը։

Ընդհանուր առմամբ, CQL-ում նվազեցվում է հետևյալ կորուստային ֆունկցիան՝

Loss = MSE(Q(s,a), target) + \\ 
\alpha (E_{a \sim \pi}[Q(s,a)] - E_{a \sim D}[Q(s,a)])

որտեղ $D$ — ուսուցման հավաքածուի գործողությունների բաշխումն է, իսկ $\pi$ — գործակալի քաղաքականությունն է։ Այսպիսով, CQL հավասարակշռում է տվյալներից սովորելու և գերագնահատումների պահպանողական նվազեցման միջև։