Vylepšení politiky
V předchozím cvičení jsi vypočítal/a Q-hodnoty pro každou dvojici stav–akce v prostředí MyGridWorld. Teď tyto Q-hodnoty využiješ k vylepšení stávající politiky. Vylepšení politiky je klíčovým krokem v reinforcement learningu – jde o to zvolit v každém stavu akci, která maximalizuje očekávanou užitnost (Q-hodnotu). Po vylepšení politiky zobrazíš nové pohyby agenta podle této nové politiky.
Prostředí je dostupné jako env, Q-hodnoty jako Q a k dispozici je také funkce render().
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Pokyny k cvičení
- Pro každý stav najdi nejlepší akci na základě Q-hodnot.
- Vyber správnou
actionpodleimproved_policy. - Proveď vybranou
actiona sleduj výsledek.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
improved_policy = {}
for state in range(num_states-1):
# Find the best action for each state based on Q-values
max_action = ____
improved_policy[state] = max_action
terminated = False
while not terminated:
# Select action based on policy
action = ____
# Execute the action
state, reward, terminated, truncated, info = ____
render()