การ mapping tokenization
ตอนนี้เราจะลองควบคุมกระบวนการ tokenization ให้ละเอียดขึ้น โดยทดลอง tokenize ข้อมูลทีละแถวหรือทีละ batch ซึ่งจะให้ผลลัพธ์เป็น DataSet object ที่จำเป็นสำหรับการฝึกโมเดล
โหลด tokenizer ไว้ให้แล้ว พร้อมกับข้อมูล train_data และ test_data
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Python เบื้องต้นสำหรับ LLMs
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Complete the function
def tokenize_function(data):
return tokenizer(data["interaction"],
____,
padding=True,
____,
max_length=64)
tokenized_in_batches = ____