Pętla interakcji w RL
Jak już wiesz, uczenie ze wzmocnieniem (RL) polega na tym, że agent podejmuje decyzje w środowisku, dążąc do maksymalizacji skumulowanej nagrody. Agent odkrywa, które akcje przynoszą największe nagrody, poprzez interakcję ze środowiskiem.
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z Gymnasium w Pythonie
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie