开始使用免费开始使用

使用 evaluate 指标

现在来评估用于分类客户支持对话的 LLM。基于您之前微调好的模型,您将使用一个新的验证数据集来评估模型表现。

部分交互内容及其对应标签已作为 validate_textvalidate_labels 为您加载。modeltokenizer 也已加载。

本练习是课程的一部分

Python 中的 LLM 入门

查看课程

练习说明

  • outputs 中的模型 logits 提取预测标签。
  • 通过比较真实标签(validate_labels)与预测标签,计算已加载的 4 个指标。

交互式实操练习

通过完成这段示例代码来试试这个练习。

accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")

# Extract the new predictions
predicted_labels = ____

# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
编辑并运行代码