开始使用免费开始使用

对文本数据集进行分词

您正在为一家旅游网站做市场调研,希望使用一个现有数据集来微调模型,以帮助分类酒店评论。您决定使用 datasets 库。

transformers 中的 AutoTokenizer 类以及 datasets 中的 load_dataset() 已预先导入。

本练习是课程的一部分

来自人类反馈的强化学习(RLHF)

查看课程

练习说明

  • 为分词器添加填充,以便将文本按等大小批次处理。
  • 使用预训练的 GPT 分词器和已定义的函数对文本数据进行分词。

交互式实操练习

通过完成这段示例代码来试试这个练习。

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
编辑并运行代码