시작하기무료로 시작하기

RLHF에서 비교와 평점 이해하기

이제 여러분 차례입니다. AI 어시스턴트를 설계하면서 사용자 만족도를 파악해야 한다고 가정해 볼게요. 비교 기반 피드백을 모을지, 아니면 평점을 받을지 고민하고 있습니다. 두 방법 사이에는 어떤 차이가 있을까요? 각 방법은 고유한 특성을 가지고 있으며, 올바른 선택이 제품의 성공에 큰 영향을 줄 수 있어요.

이 연습은 강의의 일부입니다

Reinforcement Learning from Human Feedback (RLHF)

강의 보기

실습형 인터랙티브 연습문제

이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요

연습 시작