开始使用免费开始使用

映射分词

现在,您希望对分词过程有更多控制,并尝试按行或按批次进行分词。这样还能得到一个 DataSet 对象,这是后续训练所需的。

tokenizer 已为您加载,数据分别为 train_datatest_data

本练习是课程的一部分

Python 中的 LLM 入门

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Complete the function
def tokenize_function(data):
    return tokenizer(data["interaction"], 
                     ____, 
                     padding=True, 
                     ____, 
                     max_length=64)

tokenized_in_batches = ____
编辑并运行代码