เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การ Tokenize ข้อความ

เราต้องการนำโมเดล pre-trained จาก Hugging Face มา fine-tune ด้วยข้อมูลจากทีม support ของบริษัท เพื่อช่วยจำแนกการโต้ตอบกับลูกค้าตามความเสี่ยงในการเลิกใช้บริการ (churn) ซึ่งจะช่วยให้ทีมสามารถจัดลำดับความสำคัญและรับมือกับปัญหาได้อย่างมีประสิทธิภาพมากขึ้น

เตรียมข้อมูล training และ test สำหรับการ fine-tuning ด้วยการ tokenize ข้อความ

ข้อมูล AutoTokenizer และ AutoModelForSequenceClassification ได้ถูกโหลดไว้ให้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Python เบื้องต้นสำหรับ LLMs

ดูคอร์ส

คำแนะนำการฝึกหัด

  • โหลดโมเดล pre-trained และ tokenizer เพื่อเตรียมพร้อมสำหรับการ fine-tuning
  • Tokenize ทั้ง train_data["interaction"] และ test_data["interaction"] โดยเปิดใช้งาน padding และการตัดทอนลำดับ (truncation)

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
แก้ไขและรันโค้ด