เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ประเมินข้อความที่สร้างขึ้นด้วย ROUGE

โจทย์นี้ให้ตัวอย่างข้อมูล 10 รายการจากชุดข้อมูลถาม-ตอบ (Softage-AI/sft-conversational_dataset)

เราได้ใช้ TinyLlama-1.1B สร้างคำตอบสำหรับตัวอย่างเหล่านี้แล้ว และงานของคุณคือประเมินคุณภาพของผลลัพธ์ที่สร้างขึ้นเทียบกับคำตอบที่ถูกต้อง

คำตอบที่โมเดลสร้างขึ้นอยู่ใน test_answers และคำตอบที่ถูกต้องอยู่ใน reference_answers ให้ใช้เมตริก ROUGE เพื่อประเมินคุณภาพของการสร้างข้อความ

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Fine-Tuning กับ Llama 3

ดูคอร์ส

คำแนะนำการฝึกหัด

  • นำเข้าคลาสสำหรับประเมินผลและเมตริก (เมตริก ROUGE)
  • สร้าง instance ของคลาสประเมินผล และโหลดเมตริก ROUGE
  • รัน instance ของตัวประเมินโดยส่ง reference_answers และ test_answers เพื่อคำนวณคะแนน ROUGE
  • เก็บคะแนนที่ตรวจสอบความทับซ้อนของคู่คำระหว่างคำตอบอ้างอิงและคำตอบที่สร้างขึ้นไว้ใน final_score

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the evaluation library from Hugging Face
import ____ 

# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____) 

# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____

# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)
แก้ไขและรันโค้ด