开始使用免费开始使用

文本分词

您希望利用 Hugging Face 的预训练模型,并用公司客服团队的数据进行微调,以根据流失风险来分类用户交互。这将帮助团队确定先处理哪些问题,以及如何处理,从而更具前瞻性。

通过对文本进行分词来准备用于微调的训练数据和测试数据。

AutoTokenizerAutoModelForSequenceClassification 已为您加载。

本练习是课程的一部分

Python 中的 LLM 入门

查看课程

练习说明

  • 加载预训练模型和分词器,为微调做准备。
  • train_data["interaction"]test_data["interaction"] 都进行分词,并启用填充和序列截断。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
编辑并运行代码