평가용 데이터셋 필터링
여러분은 병원이 신규 환자를 안내할 때 사용하는 회사의 헬스케어 챗봇을 위한 학습 및 평가 파이프라인을 구축하고 있어요.
여러분의 과제는 MedQuad-MedicalQnADataset을 불러와, 의료 관련 질문에 답하는 LLM의 성능을 평가하는 파이프라인을 만드는 것입니다. 데이터셋을 ds 변수에 로드하고, dataset_name에 저장된 데이터셋의 train 분할 중 처음 500개 샘플만 평가 세트로 포함하세요.
이 연습은 강의의 일부입니다
Llama 3 미세 조정(Fine-Tuning)
연습 안내
datasets에서 필요한 함수와 클래스를 가져오세요.- 데이터셋을
ds변수에 로드하세요. dataset_name에 저장된 데이터셋의train분할에서 처음 500개 샘플만 포함하도록ds를 조작해 평가 세트를 만드세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Load neccesary imports from library
from datasets import ____, ____
# Load the training split of the dataset
ds = load_dataset(dataset_name, split=____)
# Filter for the first 500 samples of the dataset
filtered_ds = ____