Bắt đầu ngayBắt đầu miễn phí

Sử dụng các chỉ số của evaluate

Đến lúc đánh giá LLM phân loại các tương tác hỗ trợ khách hàng của bạn. Tiếp nối từ mô hình đã fine-tune trước đó, giờ bạn sẽ dùng một tập dữ liệu kiểm định mới để đánh giá hiệu năng của mô hình.

Một số tương tác và nhãn tương ứng đã được nạp sẵn dưới tên validate_textvalidate_labels. modeltokenizer cũng đã được nạp.

Bài tập này là một phần của khóa học

Nhập môn LLMs trong Python

Xem khóa học

Hướng dẫn bài tập

  • Trích xuất nhãn dự đoán từ logits của mô hình trong outputs.
  • Tính bốn chỉ số đã nạp bằng cách so sánh nhãn thực (validate_labels) và nhãn dự đoán.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")

# Extract the new predictions
predicted_labels = ____

# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
Chỉnh sửa và Chạy Mã