เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ความน่าจะเป็นของการเปลี่ยนสถานะและรางวัล

สภาพแวดล้อม Cliff Walking มี 48 สถานะ โดยนับตั้งแต่ 0 ถึง 47 เรียงทีละแถวจากมุมบนซ้าย (0) ไปจนถึงมุมล่างขวา (47) เป้าหมายคือการศึกษาโครงสร้างของ ความน่าจะเป็นของการเปลี่ยนสถานะ และ รางวัล ในสภาพแวดล้อมนี้ ข้อสังเกตสำคัญคือรางวัลทุกค่าในสภาพแวดล้อมนี้เป็นค่าลบทั้งหมด รวมถึงรางวัลที่ได้เมื่อถึงเป้าหมายด้วย การออกแบบเช่นนี้มุ่งเน้นให้ลดจำนวนขั้นตอนที่ใช้ เนื่องจากแต่ละขั้นตอนมีค่าปรับ ทำให้ประสิทธิภาพเป็นปัจจัยสำคัญในการออกแบบอัลกอริทึมการเรียนรู้ที่ดี

ไลบรารี gymnasium ถูก import มาในชื่อ gym และสภาพแวดล้อมในชื่อ env นอกจากนี้ยังได้ import num_states และ num_actions จากแบบฝึกหัดก่อนหน้ามาด้วย

Image showing the cliff walking environment.

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning with Gymnasium ใน Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Choose the state
state = ____

# Extract transitions for each state-action pair
for action in range(num_actions):
    transitions = ____
    # Print details of each transition
    for transition in transitions:
        ____, ____, ____, ____ = transition
        print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")
แก้ไขและรันโค้ด