เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การใช้เมตริกจาก evaluate

ได้เวลาประเมิน LLM ที่ใช้จำแนกการโต้ตอบของฝ่ายสนับสนุนลูกค้าแล้ว ต่อจากโมเดลที่ fine-tune ไว้ก่อนหน้านี้ ขั้นตอนนี้จะใช้ชุดข้อมูล validation ชุดใหม่เพื่อประเมินประสิทธิภาพของโมเดล

ข้อความบางส่วนพร้อม label ที่สอดคล้องกันถูกโหลดไว้ให้แล้วในชื่อ validate_text และ validate_labels รวมถึง model และ tokenizer ด้วย

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Python เบื้องต้นสำหรับ LLMs

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ดึง label ที่โมเดลทำนายออกมาจาก logits ที่อยู่ใน outputs
  • คำนวณเมตริกทั้ง 4 ตัวที่โหลดไว้ โดยเปรียบเทียบ label จริง (validate_labels) กับ label ที่ทำนายได้

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")

# Extract the new predictions
predicted_labels = ____

# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
แก้ไขและรันโค้ด