开始使用免费开始使用

训练、微调与反馈

您正在开展一个项目,计划使用人类反馈强化学习(Reinforcement Learning through Human Feedback,RLHF)技术,在客服场景中优化模型性能。

以下哪些选项最准确地描述了 RLHF 的流程?

本练习是课程的一部分

Large Language Models (LLMs) 概念

查看课程

动手互动练习

通过我们的互动练习之一,将理论转化为实践

开始练习