始める無料で始める

評価用にデータセットをフィルタリングする

あなたは病院が新規患者の受け入れに利用する、社内のヘルスケア向けチャットボットの学習・評価パイプラインを構築しています。

あなたのタスクは、LLM が医療系の質問に回答できるかを評価するために、MedQuad-MedicalQnADataset を読み込むパイプラインを作ることです。dataset_name に格納されたデータセットの train 分割から先頭500件のみを評価用データとして含め、データセットを変数 ds に読み込んでください。

この演習はコースの一部です

Llama 3 のファインチューニング

コースを見る

演習の手順

  • datasets から必要な関数とクラスをインポートします。
  • データセットを変数 ds に読み込みます。
  • dataset_name に格納されたデータセットの train 分割の先頭500件のみが評価用になるように、ds を加工します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load neccesary imports from library
from datasets import ____, ____

# Load the training split of the dataset
ds = load_dataset(dataset_name, split=____)

# Filter for the first 500 samples of the dataset
filtered_ds = ____
コードを編集して実行