Przycięty współczynnik prawdopodobieństwa
Zaimplementujesz teraz przycięty współczynnik prawdopodobieństwa – kluczowy element funkcji celu PPO.
Dla przypomnienia, współczynnik prawdopodobieństwa jest zdefiniowany jako: $$\frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$$
Natomiast przycięty współczynnik prawdopodobieństwa to: \(\mathrm{clip}(r_t(\theta), 1-\varepsilon, 1+\varepsilon)\).
To ćwiczenie jest częścią kursu
Głębokie uczenie ze wzmocnieniem w Pythonie
Instrukcje do ćwiczenia
- Wyznacz prawdopodobieństwo akcji
probna podstawieaction_log_proborazprob_oldna podstawieaction_log_prob_old. - Odłącz stary logarytm prawdopodobieństwa akcji od grafu gradientów torch.
- Oblicz współczynnik prawdopodobieństwa.
- Zastosuj przycinanie do zastępczej funkcji celu.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
log_prob = torch.tensor(.5).log()
log_prob_old = torch.tensor(.4).log()
def calculate_ratios(action_log_prob, action_log_prob_old, epsilon):
# Obtain prob and prob_old
prob = ____
prob_old = ____
# Detach the old action log prob
prob_old_detached = ____.____()
# Calculate the probability ratio
ratio = ____ / ____
# Apply clipping
clipped_ratio = torch.____(ratio, ____, ____)
print(f"+{'-'*29}+\n| Ratio: {str(ratio)} |\n| Clipped ratio: {str(clipped_ratio)} |\n+{'-'*29}+\n")
return (ratio, clipped_ratio)
_ = calculate_ratios(log_prob, log_prob_old, epsilon=.2)