開始使用免費開始

檢查回饋模型

你回到模型微調的階段,發現模型效能仍然比基礎模型差。這次你想檢視回饋模型,並且已整理出一份包含模型結果的資料集,準備進行分析。你會對輸出資料做哪些檢查?

資料集已預先載入為 reward_model_results

本練習屬於課程

Reinforcement Learning from Human Feedback(RLHF)

檢視課程

動手互動練習

將理論付諸實踐,立即體驗我們的互動練習

開始練習