इवैल्युएशन के लिए डेटासेट फ़िल्टर करना
आप अपनी कंपनी के हेल्थ केयर चैटबॉट के लिए एक ट्रेनिंग और इवैल्युएशन पाइपलाइन बना रहे हैं, जिसका उपयोग अस्पताल नए मरीजों के ऑनबोर्डिंग में करते हैं.
आपका काम है MedQuad-MedicalQnADataset लोड करने की पाइपलाइन बनाना, ताकि किसी LLM की मेडिकल प्रश्नों के उत्तर देने की क्षमता का आकलन किया जा सके. आपसे कहा गया है कि डेटासेट को ds वैरिएबल में लोड करें, और dataset_name में संग्रहीत डेटासेट के train स्प्लिट के पहले 500 सैंपल्स को ही अपने इवैल्युएशन सेट में शामिल करें.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Llama 3 के साथ फाइन-ट्यूनिंग
अभ्यास निर्देश
datasetsसे आवश्यक फंक्शन्स और क्लासेज़ इम्पोर्ट करें.- डेटासेट को
dsवैरिएबल में लोड करें. dsको इस तरह संशोधित करें किdataset_nameमें संग्रहीत डेटासेट केtrainस्प्लिट के पहले 500 सैंपल्स ही आपके इवैल्युएशन सेट में शामिल हों.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load neccesary imports from library
from datasets import ____, ____
# Load the training split of the dataset
ds = load_dataset(dataset_name, split=____)
# Filter for the first 500 samples of the dataset
filtered_ds = ____