Zacznij terazZacznij za darmo

Pętla interakcji w RL

Jak już wiesz, uczenie ze wzmocnieniem (RL) polega na tym, że agent podejmuje decyzje w środowisku, dążąc do maksymalizacji skumulowanej nagrody. Agent odkrywa, które akcje przynoszą największe nagrody, poprzez interakcję ze środowiskiem.

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń

Rozpocznij ćwiczenie