НачатьНачать бесплатно

Усечённое отношение вероятностей

Теперь вам предстоит реализовать усечённое отношение вероятностей — ключевой компонент целевой функции PPO.

Для справки: отношение вероятностей определяется как: $$\frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}$$

А усечённое отношение вероятностей имеет вид: \(\mathrm{clip}(r_t(\theta), 1-\varepsilon, 1+\varepsilon)\).

Это упражнение является частью курса

Глубокое обучение с подкреплением на Python

Посмотреть курс

Инструкции к упражнению

  • Получите вероятность действия prob из action_log_prob, а prob_old — из action_log_prob_old.
  • Отсоедините старый логарифм вероятности действия от графа вычисления градиентов torch.
  • Вычислите отношение вероятностей.
  • Выполните усечение суррогатной целевой функции.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

log_prob = torch.tensor(.5).log()
log_prob_old = torch.tensor(.4).log()

def calculate_ratios(action_log_prob, action_log_prob_old, epsilon):
    # Obtain prob and prob_old
    prob = ____
    prob_old = ____
    # Detach the old action log prob
    prob_old_detached = ____.____()
    # Calculate the probability ratio
    ratio = ____ / ____
    # Apply clipping
    clipped_ratio = torch.____(ratio, ____, ____)
    print(f"+{'-'*29}+\n|         Ratio: {str(ratio)} |\n| Clipped ratio: {str(clipped_ratio)} |\n+{'-'*29}+\n")
    return (ratio, clipped_ratio)

_ = calculate_ratios(log_prob, log_prob_old, epsilon=.2)
Редактировать и запускать код