Filtrera datamängder för utvärdering
Du håller på att bygga en pipeline för träning och utvärdering av ditt företags sjukvårdschatbot, som används av sjukhus för att registrera nya patienter.
Din uppgift är att skapa en pipeline för att läsa in MedQuad-MedicalQnADataset och utvärdera en LLM:s förmåga att besvara medicinska frågor. Du ska läsa in datamängden i variabeln ds och endast inkludera de första 500 samplen från train-splitten i datamängden som lagras i dataset_name som din utvärderingsmängd.
Den här övningen är en del av kursen
Finjustering med Llama 3
Övningsinstruktioner
- Importera nödvändiga funktioner och klasser från
datasets. - Läs in datamängden i variabeln
ds. - Bearbeta
dsså att den bara innehåller de första 500 samplen fråntrain-splitten i datamängden som lagras idataset_nameoch använd det som din utvärderingsmängd.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load neccesary imports from library
from datasets import ____, ____
# Load the training split of the dataset
ds = load_dataset(dataset_name, split=____)
# Filter for the first 500 samples of the dataset
filtered_ds = ____