การใช้เมตริกจาก evaluate
ได้เวลาประเมิน LLM ที่ใช้จำแนกการโต้ตอบของฝ่ายสนับสนุนลูกค้าแล้ว ต่อจากโมเดลที่ fine-tune ไว้ก่อนหน้านี้ ขั้นตอนนี้จะใช้ชุดข้อมูล validation ชุดใหม่เพื่อประเมินประสิทธิภาพของโมเดล
ข้อความบางส่วนพร้อม label ที่สอดคล้องกันถูกโหลดไว้ให้แล้วในชื่อ validate_text และ validate_labels รวมถึง model และ tokenizer ด้วย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Python เบื้องต้นสำหรับ LLMs
คำแนะนำการฝึกหัด
- ดึง label ที่โมเดลทำนายออกมาจาก logits ที่อยู่ใน
outputs - คำนวณเมตริกทั้ง 4 ตัวที่โหลดไว้ โดยเปรียบเทียบ label จริง (
validate_labels) กับ label ที่ทำนายได้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")
# Extract the new predictions
predicted_labels = ____
# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))