Τι είναι το PPO στο πλαίσιο του RLHF και πώς υπολογίζεται η απώλεια;
sobes.tech AI
Απάντηση από AI
PPO (Proximal Policy Optimization) είναι ένας αλγόριθμος βελτιστοποίησης πολιτικής στην ενίσχυση μάθησης, ευρέως χρησιμοποιούμενος στο RLHF (Ενίσχυση Μάθησης με Ανθρώπινη Ανατροφοδότηση) για την περαιτέρω εκπαίδευση γλωσσικών μοντέλων λαμβάνοντας υπόψη την ανθρώπινη ανατροφοδότηση.
Η κύρια ιδέα του PPO είναι να ενημερώνει την πολιτική έτσι ώστε να μην αποκλίνει πολύ από την τρέχουσα, αποτρέποντας την αστάθεια στη μάθηση. Για το σκοπό αυτό, χρησιμοποιείται μια ειδική λειτουργία απώλειας που περιορίζει το μέγεθος της ενημέρωσης.
Η απώλεια στο PPO υπολογίζεται συνήθως ως:
L^{CLIP}( heta) = \mathbb{E}_t \left[ \min \left( r_t(\theta) \hat{A}_t, \text{clip}(r_t(\theta), 1 - \epsilon, 1 + \epsilon) \hat{A}_t \right) \right]
όπου:
- $r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$ — η αναλογία πιθανοτήτων της νέας και παλιάς πολιτικής για την ενέργεια $a_t$ στην κατάσταση $s_t$;
- $\hat{A}_t$ — εκτίμηση του πλεονεκτήματος;
- $\epsilon$ — υπερπαραμέτρο που ορίζει το επιτρεπτό εύρος αλλαγών.
Έτσι, η απώλεια τιμωρεί τις ενημερώσεις που αλλάζουν πολύ την πολιτική, διατηρώντας τη σταθερότητα και την αποτελεσματικότητα της μάθησης. Στο RLHF, το PPO χρησιμοποιείται για την βελτιστοποίηση του μοντέλου λαμβάνοντας υπόψη τις ανταμοιβές που λαμβάνονται από την ανθρώπινη ανατροφοδότηση.