Tokenize ชุดข้อมูลข้อความ
คุณกำลังทำวิจัยตลาดให้กับเว็บไซต์ท่องเที่ยว และต้องการใช้ชุดข้อมูลที่มีอยู่เพื่อ fine-tune โมเดลสำหรับจำแนกรีวิวโรงแรม โดยเลือกใช้ไลบรารี datasets
คลาส AutoTokenizer ถูก import มาจาก transformers แล้ว และ load_dataset() ถูก import มาจาก datasets แล้วเช่นกัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning from Human Feedback (RLHF)
คำแนะนำการฝึกหัด
- เพิ่ม padding ให้กับ tokenizer เพื่อประมวลผลข้อความเป็น batch ที่มีขนาดเท่ากัน
- Tokenize ข้อมูลข้อความโดยใช้ GPT tokenizer ที่ผ่านการ pre-train มาแล้ว ร่วมกับฟังก์ชันที่กำหนดไว้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
dataset = load_dataset("argilla/tripadvisor-hotel-reviews")
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Add padding with the pad token
tokenizer.____
def tokenize_function(examples):
return tokenizer(examples["text"], padding="max_length", truncation=True)
# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)