文本分词
您希望利用 Hugging Face 的预训练模型,并用公司客服团队的数据进行微调,以根据流失风险来分类用户交互。这将帮助团队确定先处理哪些问题,以及如何处理,从而更具前瞻性。
通过对文本进行分词来准备用于微调的训练数据和测试数据。
AutoTokenizer 和 AutoModelForSequenceClassification 已为您加载。
本练习是课程的一部分
Python 中的 LLM 入门
练习说明
- 加载预训练模型和分词器,为微调做准备。
- 对
train_data["interaction"]和test_data["interaction"]都进行分词,并启用填充和序列截断。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)