or
To ćwiczenie jest częścią kursu
Odkryj, w jaki sposób głębokie uczenie ze wzmocnieniem usprawnia tradycyjne uczenie ze wzmocnieniem – poznaj teorię i zaimplementuj swój pierwszy algorytm Deep Q-Learning.
Zagłęb się w Deep Q-learning, implementując oryginalny algorytm DQN z buforowaniem doświadczeń, strategią epsilon-zachłanną i stałymi celami Q. Następnie poznasz dwa interesujące rozszerzenia poprawiające wydajność i stabilność Deep Q-learning: Double DQN oraz Priorytetyzowany bufor doświadczeń.
Bieżące ćwiczenie
Poznaj podstawowe koncepcje metod gradientu polityki stosowanych w DRL. Zaczniesz od twierdzenia o gradiencie polityki, które stanowi fundament tych metod, a następnie zaimplementujesz algorytm REINFORCE – skuteczne podejście do uczenia polityk. Rozdział przeprowadzi cię też przez metody Actor-Critic, ze szczególnym uwzględnieniem algorytmu Advantage Actor-Critic (A2C), który łączy zalety metod gradientu polityki i metod opartych na wartości, zwiększając efektywność i stabilność uczenia.
Poznaj Proximal Policy Optimization (PPO) jako niezawodne narzędzie w DRL. Następnie dowiesz się, jak stosować bonus entropijny w PPO – zachęca on do eksploracji i zapobiega przedwczesnemu zbieganiu do polityk deterministycznych. Poznasz też aktualizacje wsadowe w metodach gradientu polityki. Na końcu nauczysz się optymalizacji hiperparametrów za pomocą Optuny – potężnego narzędzia do poprawy wydajności modeli DRL.