A arquitetura da rede de políticas

Crie a arquitetura de uma rede de políticas que você poderá usar posteriormente para treinar seu agente de gradiente de políticas.

A rede de políticas recebe o estado como entrada e gera uma probabilidade no espaço de ação. Para o ambiente do Lunar Lander, você trabalha com quatro ações discretas e, portanto, deseja que sua rede produza uma probabilidade para cada uma dessas ações.

Este exercício faz parte do curso

Aprendizado por reforço profundo em Python

Instruções do exercício

Indique o tamanho da camada de saída da rede de políticas; para maior flexibilidade, use o nome da variável em vez do número real.
Certifique-se de que a camada final retorne probabilidades.

Exercício interativo prático

Experimente este exercício completando este código de exemplo.

class PolicyNetwork(nn.Module):
  def __init__(self, state_size, action_size):
    super(PolicyNetwork, self).__init__()
    self.fc1 = nn.Linear(state_size, 64)
    self.fc2 = nn.Linear(64, 64)
    # Give the desired size for the output layer
    self.fc3 = nn.Linear(64, ____)

  def forward(self, state):
    x = torch.relu(self.fc1(torch.tensor(state)))
    x = torch.relu(self.fc2(x))
    # Obtain the action probabilities
    action_probs = ____(self.fc3(x), dim=-1)
    return action_probs
  
policy_network = PolicyNetwork(8, 4)
action_probs = policy_network(state)
print('Action probabilities:', action_probs)

Editar e executar o código

Este exercício faz parte do curso

Aprendizado por reforço profundo em Python

AvançadoNível de habilidade

4.8+

Iniciar curso de graça

Descubra como o aprendizado por reforço profundo melhora o aprendizado por reforço tradicional enquanto você estuda e implementa seu primeiro algoritmo de Deep Q Learning.

Exercise 1: Introdução ao aprendizado por reforço profundo Exercise 2: Ambiente e configuração da rede neural Exercise 3: DRL ciclo de treinamento Exercise 4: Introdução à aprendizagem profunda de Q Exercise 5: Aprendizagem profunda e DQN Exercise 6: A arquitetura da rede Q Exercise 7: Instanciando a rede Q Exercise 8: O algoritmo barebone DQN Exercise 9: Barebone DQN seleção de ações Exercise 10: Barebone DQN função de perda Exercise 11: Treinamento do barebone DQN

Mergulhe no Deep Q-learning implementando o algoritmo original DQN, com Experience Replay, epsilon-greediness e Q-targets fixos. Além de DQN, você explorará duas extensões fascinantes que melhoram o desempenho e a estabilidade do Deep Q-learning: Duplo DQN e repetição de experiência priorizada.

Exercise 1: DQN com repetição de experiência Exercise 2: A fila dupla Exercise 3: Buffer de reprodução de experiência Exercise 4: DQN com repetição de experiência Exercise 5: O algoritmo DQN completo Exercise 6: Epsilon-greediness Exercise 7: Metas Q fixas Exercise 8: Implementação do algoritmo DQN completo Exercise 9: Duplo DQN Exercise 10: Rede on-line e rede de destino em DDQN Exercise 11: Treinar a dupla DQN Exercise 12: Repetição de experiência priorizada Exercise 13: Buffer de reprodução de experiência priorizada Exercise 14: Amostragem do buffer PER Exercise 15: DQN com reprodução de experiência priorizada

Conheça os conceitos básicos dos métodos de gradiente de política encontrados em DRL. Você começará com o teorema do gradiente de política, que forma a base para esses métodos. Em seguida, você implementará o algoritmo REINFORCE, uma abordagem poderosa para aprender políticas. Em seguida, o capítulo guiará você pelos métodos Actor-Critic, com foco no algoritmo Advantage Actor-Critic (A2C), que combina os pontos fortes dos métodos de gradiente de política e baseados em valor para aumentar a eficiência e a estabilidade do aprendizado.

Exercise 1: Introdução ao gradiente de políticas Exercise 2: A arquitetura da rede de políticas

Exercício atual

Exercise 3: Trabalho com distribuições discretas Exercise 4: Gradiente de políticas e REINFORCE Exercise 5: Seleção de ações em REINFORCE Exercise 6: Treinamento do algoritmo REINFORCE Exercise 7: Vantagem do ator crítico Exercise 8: Rede de críticos Exercise 9: Cálculos de perda do Actor Critic Exercise 10: Treinamento do algoritmo A2C

Explore a otimização da política proximal (PPO) para obter um desempenho robusto em DRL. Em seguida, você examinará o uso de um bônus de entropia em PPO, que incentiva a exploração ao evitar a convergência prematura para políticas determinísticas. Você também aprenderá sobre atualizações em lote em métodos de gradiente de política. Por fim, você aprenderá sobre a otimização de hiperparâmetros com o Optuna, uma ferramenta avançada para otimizar o desempenho dos seus modelos DRL.

Exercise 1: Otimização da política proximal Exercise 2: A taxa de probabilidade cortada Exercise 3: A função objetiva substituta recortada Exercise 4: Bônus de entropia e PPO Exercise 5: Playground de entropia Exercise 6: Treinamento do algoritmo PPO Exercise 7: Atualizações em lote no gradiente de política Exercise 8: Minibatch e DRL Exercise 9: A2C com atualizações em lote Exercise 10: Otimização de hiperparâmetros com o Optuna Exercise 11: Hiperparâmetro ou não?Exercise 12: Prática com o Optuna Exercise 13: Parabéns!