使用 AutoTokenizer 预处理文本
您正在构建一款精准农业应用,帮助农户就田间遇到的问题进行提问。您将利用一个包含常见问题与解答的数据集;该数据集包含以下字段:
question:常见农业问题answers:对应农业问题的解答
作为分布式训练的第一步,您将先对这个文本数据集进行预处理。
已预加载的数据:
dataset包含一个农业问答的示例数据集- 已从
transformers导入AutoTokenizer
本练习是课程的一部分
使用 PyTorch 高效训练 AI 模型
练习说明
- 加载一个预训练的
tokenizer。 - 使用
tokenizer对example["question"]进行分词。 - 将
encode()函数应用到dataset。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")
def encode(example):
# Tokenize the "question" field of the training example
return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")
# Map the function to the dataset
dataset = ____.____(____, batched=True)
dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)
print(dataset)