对文本数据集进行分词
您正在为一家旅游网站做市场调研,希望使用一个现有数据集来微调模型,以帮助分类酒店评论。您决定使用 datasets 库。
transformers 中的 AutoTokenizer 类以及 datasets 中的 load_dataset() 已预先导入。
本练习是课程的一部分
来自人类反馈的强化学习(RLHF)
练习说明
- 为分词器添加填充,以便将文本按等大小批次处理。
- 使用预训练的 GPT 分词器和已定义的函数对文本数据进行分词。
交互式实操练习
通过完成这段示例代码来试试这个练习。
dataset = load_dataset("argilla/tripadvisor-hotel-reviews")
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Add padding with the pad token
tokenizer.____
def tokenize_function(examples):
return tokenizer(examples["text"], padding="max_length", truncation=True)
# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)