Ambiente e configuração da rede neural

Você começará configurando o ambiente que usará ao longo do curso: o ambiente Lunar Lander, em que um agente controla os propulsores de um veículo que tenta pousar na lua.

torch``torch.nn, torch.optim e gym são importados para seus exercícios.

Este exercício faz parte do curso

Aprendizado por reforço profundo em Python

Instruções de exercício

Inicialize o ambiente do Lunar Lander em gym (LunarLander-v2).
Defina uma única camada de transformação linear, com dimensão de entrada dim_inputs e dimensão de saída dim_outputs.
Instancie a rede neural para a dimensão de entrada 8 e a dimensão de saída 4.
Forneça os parâmetros ao otimizador Adam.

Exercício interativo prático

Experimente este exercício preenchendo este código de exemplo.

# Initiate the Lunar Lander environment
env = gym.____

class Network(nn.Module):
    def __init__(self, dim_inputs, dim_outputs):
        super(Network, self).__init__()
        # Define a linear transformation layer 
        self.linear = ____
    def forward(self, x):
        return self.linear(x)

# Instantiate the network
network = ____

# Initialize the optimizer
optimizer = optim.Adam(____, lr=0.0001)

print("Network initialized as:\n", network)

Editar e executar código

Este exercício faz parte do curso

Aprendizado por reforço profundo em Python

AvançadoNível de habilidade

4.8+

Iniciar curso gratuitamente

Descubra como o aprendizado por reforço profundo melhora o aprendizado por reforço tradicional enquanto você estuda e implementa seu primeiro algoritmo de Deep Q Learning.

Exercise 1: Introdução ao aprendizado por reforço profundo Exercise 2: Ambiente e configuração da rede neural

Exercício atual

Exercise 3: DRL ciclo de treinamento Exercise 4: Introdução à aprendizagem profunda de Q Exercise 5: Aprendizagem profunda e DQN Exercise 6: A arquitetura da rede Q Exercise 7: Instanciando a rede Q Exercise 8: O algoritmo barebone DQN Exercise 9: Barebone DQN seleção de ações Exercise 10: Barebone DQN função de perda Exercise 11: Treinamento do barebone DQN

Mergulhe no Deep Q-learning implementando o algoritmo original DQN, com Experience Replay, epsilon-greediness e Q-targets fixos. Além de DQN, você explorará duas extensões fascinantes que melhoram o desempenho e a estabilidade do Deep Q-learning: Duplo DQN e repetição de experiência priorizada.

Exercise 1: DQN com repetição de experiência Exercise 2: A fila dupla Exercise 3: Buffer de reprodução de experiência Exercise 4: DQN com repetição de experiência Exercise 5: O algoritmo DQN completo Exercise 6: Epsilon-greediness Exercise 7: Metas Q fixas Exercise 8: Implementação do algoritmo DQN completo Exercise 9: Duplo DQN Exercise 10: Rede on-line e rede de destino em DDQN Exercise 11: Treinar a dupla DQN Exercise 12: Repetição de experiência priorizada Exercise 13: Buffer de reprodução de experiência priorizada Exercise 14: Amostragem do buffer PER Exercise 15: DQN com reprodução de experiência priorizada

Conheça os conceitos básicos dos métodos de gradiente de política encontrados em DRL. Você começará com o teorema do gradiente de política, que forma a base para esses métodos. Em seguida, você implementará o algoritmo REINFORCE, uma abordagem poderosa para aprender políticas. Em seguida, o capítulo guiará você pelos métodos Actor-Critic, com foco no algoritmo Advantage Actor-Critic (A2C), que combina os pontos fortes dos métodos de gradiente de política e baseados em valor para aumentar a eficiência e a estabilidade do aprendizado.

Exercise 1: Introdução ao gradiente de políticas Exercise 2: A arquitetura da rede de políticas Exercise 3: Trabalho com distribuições discretas Exercise 4: Gradiente de políticas e REINFORCE Exercise 5: Seleção de ações em REINFORCE Exercise 6: Treinamento do algoritmo REINFORCE Exercise 7: Vantagem do ator crítico Exercise 8: Rede de críticos Exercise 9: Cálculos de perda do Actor Critic Exercise 10: Treinamento do algoritmo A2C

Explore a otimização da política proximal (PPO) para obter um desempenho robusto em DRL. Em seguida, você examinará o uso de um bônus de entropia em PPO, que incentiva a exploração ao evitar a convergência prematura para políticas determinísticas. Você também aprenderá sobre atualizações em lote em métodos de gradiente de política. Por fim, você aprenderá sobre a otimização de hiperparâmetros com o Optuna, uma ferramenta avançada para otimizar o desempenho dos seus modelos DRL.

Exercise 1: Otimização da política proximal Exercise 2: A taxa de probabilidade cortada Exercise 3: A função objetiva substituta recortada Exercise 4: Bônus de entropia e PPO Exercise 5: Playground de entropia Exercise 6: Treinamento do algoritmo PPO Exercise 7: Atualizações em lote no gradiente de política Exercise 8: Minibatch e DRL Exercise 9: A2C com atualizações em lote Exercise 10: Otimização de hiperparâmetros com o Optuna Exercise 11: Hiperparâmetro ou não?Exercise 12: Prática com o Optuna Exercise 13: Parabéns!