Začněte nyníZačněte zdarma

Filtrování datasetů pro vyhodnocení

Buduješ pipeline pro trénování a vyhodnocování chatbota pro zdravotnictví, kterého nemocnice využívají při registraci nových pacientů.

Tvým úkolem je vytvořit pipeline pro načtení datasetu MedQuad-MedicalQnADataset, pomocí nějž budeš hodnotit schopnost LLM odpovídat na lékařské otázky. Načti dataset do proměnné ds a jako evaluační sadu zahrň pouze prvních 500 vzorků ze split části train datasetu uloženého v dataset_name.

Toto cvičení je součástí kurzu

Fine-Tuning s Llama 3

Zobrazit kurz

Pokyny k cvičení

  • Importuj potřebné funkce a třídy z knihovny datasets.
  • Načti dataset do proměnné ds.
  • Uprav ds tak, aby obsahoval pouze prvních 500 vzorků ze split části train datasetu uloženého v dataset_name, a použij je jako evaluační sadu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load neccesary imports from library
from datasets import ____, ____

# Load the training split of the dataset
ds = load_dataset(dataset_name, split=____)

# Filter for the first 500 samples of the dataset
filtered_ds = ____
Upravit a spustit kód