เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

Tokenize ชุดข้อมูลข้อความ

คุณกำลังทำวิจัยตลาดให้กับเว็บไซต์ท่องเที่ยว และต้องการใช้ชุดข้อมูลที่มีอยู่เพื่อ fine-tune โมเดลสำหรับจำแนกรีวิวโรงแรม โดยเลือกใช้ไลบรารี datasets

คลาส AutoTokenizer ถูก import มาจาก transformers แล้ว และ load_dataset() ถูก import มาจาก datasets แล้วเช่นกัน

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning from Human Feedback (RLHF)

ดูคอร์ส

คำแนะนำการฝึกหัด

  • เพิ่ม padding ให้กับ tokenizer เพื่อประมวลผลข้อความเป็น batch ที่มีขนาดเท่ากัน
  • Tokenize ข้อมูลข้อความโดยใช้ GPT tokenizer ที่ผ่านการ pre-train มาแล้ว ร่วมกับฟังก์ชันที่กำหนดไว้

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
แก้ไขและรันโค้ด