評価用にデータセットをフィルタリングする
あなたは病院が新規患者の受け入れに利用する、社内のヘルスケア向けチャットボットの学習・評価パイプラインを構築しています。
あなたのタスクは、LLM が医療系の質問に回答できるかを評価するために、MedQuad-MedicalQnADataset を読み込むパイプラインを作ることです。dataset_name に格納されたデータセットの train 分割から先頭500件のみを評価用データとして含め、データセットを変数 ds に読み込んでください。
この演習はコースの一部です
Llama 3 のファインチューニング
演習の手順
datasetsから必要な関数とクラスをインポートします。- データセットを変数
dsに読み込みます。 dataset_nameに格納されたデータセットのtrain分割の先頭500件のみが評価用になるように、dsを加工します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load neccesary imports from library
from datasets import ____, ____
# Load the training split of the dataset
ds = load_dataset(dataset_name, split=____)
# Filter for the first 500 samples of the dataset
filtered_ds = ____