現在換你來試試。假設你正在設計一個 AI 助手,需要了解使用者滿意度。你正考慮要蒐集「比較式回饋」,或改用「評分」。但兩者有什麼差異?每種方法都有其特色,選對方法會大幅影響產品的成效。
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
本章介紹 Reinforcement Learning with Human Feedback(RLHF)的基礎:這是一種運用人類輸入來幫助 AI 模型更有效學習的技術。先從了解它與傳統強化學習的差異開始,並說明為何人類回饋能在各種領域提升 AI 表現。
在本章中,你將學會如何建立蒐集人類回饋的系統。從成對比較到不確定性取樣,了解蒐集高品質資料的最佳做法,並探索能強化資料蒐集的策略。
當前練習
本章將帶你進入 RLHF 訓練的核心。內容包含使用 PPO 進行微調、提升訓練效率的技巧,以及如何處理模型與指標目標可能出現的偏離。
在本章(亦為本課程的最後一章)中,你將探索評估並改進模型效能的關鍵方法:從微調用的評估指標到導入多元回饋來源,提供一套完整工具組,幫助你有效精煉模型。