시작하기무료로 시작하기

리워드 모델 점검하기

모델을 다시 미세 조정해 보았지만, 성능이 여전히 베이스 모델보다 떨어진다는 점을 발견했어요. 이번에는 리워드 모델을 들여다보고자 하며, 분석할 수 있도록 모델의 결과를 모아 데이터셋을 준비해 두었어요. 출력 데이터를 대상으로 어떤 점검을 하시겠어요?

데이터셋은 reward_model_results로 미리 가져와 두었습니다.

이 연습은 강의의 일부입니다

Reinforcement Learning from Human Feedback (RLHF)

강의 보기

실습형 인터랙티브 연습문제

이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요

연습 시작