ประเมินข้อความที่สร้างขึ้นด้วย ROUGE
โจทย์นี้ให้ตัวอย่างข้อมูล 10 รายการจากชุดข้อมูลถาม-ตอบ (Softage-AI/sft-conversational_dataset)
เราได้ใช้ TinyLlama-1.1B สร้างคำตอบสำหรับตัวอย่างเหล่านี้แล้ว และงานของคุณคือประเมินคุณภาพของผลลัพธ์ที่สร้างขึ้นเทียบกับคำตอบที่ถูกต้อง
คำตอบที่โมเดลสร้างขึ้นอยู่ใน test_answers และคำตอบที่ถูกต้องอยู่ใน reference_answers ให้ใช้เมตริก ROUGE เพื่อประเมินคุณภาพของการสร้างข้อความ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Fine-Tuning กับ Llama 3
คำแนะนำการฝึกหัด
- นำเข้าคลาสสำหรับประเมินผลและเมตริก (เมตริก ROUGE)
- สร้าง instance ของคลาสประเมินผล และโหลดเมตริก ROUGE
- รัน instance ของตัวประเมินโดยส่ง
reference_answersและtest_answersเพื่อคำนวณคะแนน ROUGE - เก็บคะแนนที่ตรวจสอบความทับซ้อนของคู่คำระหว่างคำตอบอ้างอิงและคำตอบที่สร้างขึ้นไว้ใน
final_score
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the evaluation library from Hugging Face
import ____
# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____)
# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____
# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)