ความน่าจะเป็นของการเปลี่ยนสถานะและรางวัล
สภาพแวดล้อม Cliff Walking มี 48 สถานะ โดยนับตั้งแต่ 0 ถึง 47 เรียงทีละแถวจากมุมบนซ้าย (0) ไปจนถึงมุมล่างขวา (47) เป้าหมายคือการศึกษาโครงสร้างของ ความน่าจะเป็นของการเปลี่ยนสถานะ และ รางวัล ในสภาพแวดล้อมนี้ ข้อสังเกตสำคัญคือรางวัลทุกค่าในสภาพแวดล้อมนี้เป็นค่าลบทั้งหมด รวมถึงรางวัลที่ได้เมื่อถึงเป้าหมายด้วย การออกแบบเช่นนี้มุ่งเน้นให้ลดจำนวนขั้นตอนที่ใช้ เนื่องจากแต่ละขั้นตอนมีค่าปรับ ทำให้ประสิทธิภาพเป็นปัจจัยสำคัญในการออกแบบอัลกอริทึมการเรียนรู้ที่ดี
ไลบรารี gymnasium ถูก import มาในชื่อ gym และสภาพแวดล้อมในชื่อ env นอกจากนี้ยังได้ import num_states และ num_actions จากแบบฝึกหัดก่อนหน้ามาด้วย

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning with Gymnasium ใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Choose the state
state = ____
# Extract transitions for each state-action pair
for action in range(num_actions):
transitions = ____
# Print details of each transition
for transition in transitions:
____, ____, ____, ____ = transition
print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")