开始使用免费开始使用

使用 AutoTokenizer 预处理文本

您正在构建一款精准农业应用,帮助农户就田间遇到的问题进行提问。您将利用一个包含常见问题与解答的数据集;该数据集包含以下字段:

  • question:常见农业问题
  • answers:对应农业问题的解答

作为分布式训练的第一步,您将先对这个文本数据集进行预处理。

已预加载的数据:

  • dataset 包含一个农业问答的示例数据集
  • 已从 transformers 导入 AutoTokenizer

本练习是课程的一部分

使用 PyTorch 高效训练 AI 模型

查看课程

练习说明

  • 加载一个预训练的 tokenizer
  • 使用 tokenizerexample["question"] 进行分词。
  • encode() 函数应用到 dataset

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")

def encode(example):
    # Tokenize the "question" field of the training example
    return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")

# Map the function to the dataset
dataset = ____.____(____, batched=True)

dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)

print(dataset)
编辑并运行代码