Začněte nyníZačněte zdarma

Vylepšení politiky

V předchozím cvičení jsi vypočítal/a Q-hodnoty pro každou dvojici stav–akce v prostředí MyGridWorld. Teď tyto Q-hodnoty využiješ k vylepšení stávající politiky. Vylepšení politiky je klíčovým krokem v reinforcement learningu – jde o to zvolit v každém stavu akci, která maximalizuje očekávanou užitnost (Q-hodnotu). Po vylepšení politiky zobrazíš nové pohyby agenta podle této nové politiky.

Prostředí je dostupné jako env, Q-hodnoty jako Q a k dispozici je také funkce render().

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Pokyny k cvičení

  • Pro každý stav najdi nejlepší akci na základě Q-hodnot.
  • Vyber správnou action podle improved_policy.
  • Proveď vybranou action a sleduj výsledek.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

improved_policy = {}

for state in range(num_states-1):
    # Find the best action for each state based on Q-values
    max_action = ____
    improved_policy[state] = max_action

terminated = False
while not terminated:
  # Select action based on policy 
  action = ____
  # Execute the action
  state, reward, terminated, truncated, info = ____
  render()
Upravit a spustit kód