開始使用免費開始

訓練、微調與回饋

你正在進行一個專案,打算在客服情境中以人類回饋強化學習(Reinforcement Learning through Human Feedback,RLHF)來最佳化模型效能。

以下哪一個選項最能準確描述 RLHF 的流程?

本練習屬於課程

Large Language Models (LLMs) 概念

檢視課程

動手互動練習

將理論付諸實踐,立即體驗我們的互動練習

開始練習