Filtrowanie zbiorów danych do ewaluacji
Budujesz potok treningowy i ewaluacyjny dla firmowego chatbota medycznego, wykorzystywanego przez szpitale podczas rejestracji nowych pacjentów.
Twoim zadaniem jest stworzenie potoku do wczytania zbioru MedQuad-MedicalQnADataset w celu ewaluacji modelu językowego pod kątem umiejętności odpowiadania na pytania medyczne. Wczytaj zbiór danych do zmiennej ds i uwzględnij wyłącznie pierwsze 500 próbek z podziału train zbioru zapisanego w dataset_name jako zestaw ewaluacyjny.
To ćwiczenie jest częścią kursu
Fine-Tuning z Llama 3
Instrukcje do ćwiczenia
- Zaimportuj niezbędne funkcje i klasy z biblioteki
datasets. - Wczytaj zbiór danych do zmiennej
ds. - Zmodyfikuj
dstak, aby zawierał pierwsze 500 próbek z podziałutrainzbioru zapisanego wdataset_name– będzie to twój zestaw ewaluacyjny.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load neccesary imports from library
from datasets import ____, ____
# Load the training split of the dataset
ds = load_dataset(dataset_name, split=____)
# Filter for the first 500 samples of the dataset
filtered_ds = ____