Sử dụng các chỉ số của evaluate
Đến lúc đánh giá LLM phân loại các tương tác hỗ trợ khách hàng của bạn. Tiếp nối từ mô hình đã fine-tune trước đó, giờ bạn sẽ dùng một tập dữ liệu kiểm định mới để đánh giá hiệu năng của mô hình.
Một số tương tác và nhãn tương ứng đã được nạp sẵn dưới tên validate_text và validate_labels. model và tokenizer cũng đã được nạp.
Bài tập này là một phần của khóa học
Nhập môn LLMs trong Python
Hướng dẫn bài tập
- Trích xuất nhãn dự đoán từ logits của mô hình trong
outputs. - Tính bốn chỉ số đã nạp bằng cách so sánh nhãn thực (
validate_labels) và nhãn dự đoán.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")
# Extract the new predictions
predicted_labels = ____
# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))