การกรองชุดข้อมูลสำหรับการประเมินผล
คุณกำลังสร้าง pipeline สำหรับการฝึกและประเมินผลให้กับแชทบอทด้านสุขภาพของบริษัท ซึ่งโรงพยาบาลใช้ในการรับผู้ป่วยรายใหม่
งานของคุณคือสร้าง pipeline เพื่อโหลด MedQuad-MedicalQnADataset สำหรับประเมินความสามารถของ LLM ในการตอบคำถามทางการแพทย์ โดยให้โหลดชุดข้อมูลไว้ในตัวแปร ds และเลือกเฉพาะ 500 ตัวอย่างแรกจาก split train ของชุดข้อมูลที่เก็บอยู่ใน dataset_name เป็นชุดข้อมูลสำหรับการประเมินผล
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Fine-Tuning กับ Llama 3
คำแนะนำการฝึกหัด
- นำเข้าฟังก์ชันและคลาสที่จำเป็นจาก
datasets - โหลดชุดข้อมูลไว้ในตัวแปร
ds - ปรับแต่ง
dsให้เหลือเฉพาะ 500 ตัวอย่างแรกจาก splittrainของชุดข้อมูลที่เก็บอยู่ในdataset_nameเพื่อใช้เป็นชุดข้อมูลสำหรับการประเมินผล
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load neccesary imports from library
from datasets import ____, ____
# Load the training split of the dataset
ds = load_dataset(dataset_name, split=____)
# Filter for the first 500 samples of the dataset
filtered_ds = ____