映射分词
现在,您希望对分词过程有更多控制,并尝试按行或按批次进行分词。这样还能得到一个 DataSet 对象,这是后续训练所需的。
tokenizer 已为您加载,数据分别为 train_data 和 test_data。
本练习是课程的一部分
Python 中的 LLM 入门
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Complete the function
def tokenize_function(data):
return tokenizer(data["interaction"],
____,
padding=True,
____,
max_length=64)
tokenized_in_batches = ____