在機器學習領域中,強化學習(RL)是一種讓模型學會做決策的獨特方法。它已廣泛應用在各種領域。
以下哪一個敘述關於 RL 是正確的?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
透過基礎概念、角色與應用,帶你進入強化學習(RL)的精彩世界。逐步掌握 RL 架構,了解代理與環境的互動。你也會學到如何使用 Gymnasium 函式庫建立環境、視覺化狀態並執行動作,為 RL 的概念與實作打下紮實基礎。
當前練習
更深入探討以基於模型的學習為重點的 RL。解析馬可夫決策流程(MDP),並理解其關鍵組成。進一步學習策略與價值函式,並透過策略疊代與價值疊代技巧,培養策略最佳化的專業能力。
展開無模型學習在 RL 中的動態旅程。首先認識基礎的蒙地卡羅方法,並實作首次造訪與每次造訪的蒙地卡羅預測演算法。接著進入時序差分學習,探索 SARSA 演算法。最後深入 Q-learning,並在具挑戰性的環境中分析其收斂性。
深入無模型 RL 的進階策略,著重於強化決策演算法。學習 Expected SARSA 以更精準地更新策略,以及 Double Q-learning 以降低高估偏誤。探討探索-利用權衡,熟練使用 epsilon-greedy 與 epsilon-decay 策略來做出最佳動作選擇。最後挑戰多拉霸(Multi-Armed Bandit)問題,應用各種策略在不確定下解決決策難題。