Filtrování datasetů pro vyhodnocení
Buduješ pipeline pro trénování a vyhodnocování chatbota pro zdravotnictví, kterého nemocnice využívají při registraci nových pacientů.
Tvým úkolem je vytvořit pipeline pro načtení datasetu MedQuad-MedicalQnADataset, pomocí nějž budeš hodnotit schopnost LLM odpovídat na lékařské otázky. Načti dataset do proměnné ds a jako evaluační sadu zahrň pouze prvních 500 vzorků ze split části train datasetu uloženého v dataset_name.
Toto cvičení je součástí kurzu
Fine-Tuning s Llama 3
Pokyny k cvičení
- Importuj potřebné funkce a třídy z knihovny
datasets. - Načti dataset do proměnné
ds. - Uprav
dstak, aby obsahoval pouze prvních 500 vzorků ze split částitraindatasetu uloženého vdataset_name, a použij je jako evaluační sadu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load neccesary imports from library
from datasets import ____, ____
# Load the training split of the dataset
ds = load_dataset(dataset_name, split=____)
# Filter for the first 500 samples of the dataset
filtered_ds = ____