開始使用免費開始

定義確定性策略

在這個練習中,你會使用自訂環境 MyGridWorld,也就是你在影片中看到的同一個環境。這個環境是一個格子世界,智能體的目標是盡快抵達鑽石。你的任務是依照下圖所示,定義一個引導智能體行為的策略。

Image showing the policy: 
states 0, 1, 6, 7 - action right. 
states 2, 3 - action down. 
states 4, 5 - action left.

動作以數字表示:(0 → left,1 → down,2 → right,3 → up)。

已為你匯入 gymnasium 函式庫為 gym,同時提供了 render() 函式。

本練習屬於課程

使用 Python 的 Gymnasium 進行強化學習

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create the environment
env = ____
state, info = env.reset()

# Define the policy
policy = ____
編輯並執行程式碼