Zacznij terazZacznij za darmo

Filtrowanie zbiorów danych do ewaluacji

Budujesz potok treningowy i ewaluacyjny dla firmowego chatbota medycznego, wykorzystywanego przez szpitale podczas rejestracji nowych pacjentów.

Twoim zadaniem jest stworzenie potoku do wczytania zbioru MedQuad-MedicalQnADataset w celu ewaluacji modelu językowego pod kątem umiejętności odpowiadania na pytania medyczne. Wczytaj zbiór danych do zmiennej ds i uwzględnij wyłącznie pierwsze 500 próbek z podziału train zbioru zapisanego w dataset_name jako zestaw ewaluacyjny.

To ćwiczenie jest częścią kursu

Fine-Tuning z Llama 3

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj niezbędne funkcje i klasy z biblioteki datasets.
  • Wczytaj zbiór danych do zmiennej ds.
  • Zmodyfikuj ds tak, aby zawierał pierwsze 500 próbek z podziału train zbioru zapisanego w dataset_name – będzie to twój zestaw ewaluacyjny.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load neccesary imports from library
from datasets import ____, ____

# Load the training split of the dataset
ds = load_dataset(dataset_name, split=____)

# Filter for the first 500 samples of the dataset
filtered_ds = ____
Edytuj i uruchom kod