你回到模型微調的階段,發現模型效能仍然比基礎模型差。這次你想檢視回饋模型,並且已整理出一份包含模型結果的資料集,準備進行分析。你會對輸出資料做哪些檢查?
資料集已預先載入為 reward_model_results。
reward_model_results
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
本章介紹 Reinforcement Learning with Human Feedback(RLHF)的基礎:這是一種運用人類輸入來幫助 AI 模型更有效學習的技術。先從了解它與傳統強化學習的差異開始,並說明為何人類回饋能在各種領域提升 AI 表現。
在本章中,你將學會如何建立蒐集人類回饋的系統。從成對比較到不確定性取樣,了解蒐集高品質資料的最佳做法,並探索能強化資料蒐集的策略。
本章將帶你進入 RLHF 訓練的核心。內容包含使用 PPO 進行微調、提升訓練效率的技巧,以及如何處理模型與指標目標可能出現的偏離。
在本章(亦為本課程的最後一章)中,你將探索評估並改進模型效能的關鍵方法:從微調用的評估指標到導入多元回饋來源,提供一套完整工具組,幫助你有效精煉模型。
當前練習