การ Tokenize ข้อความ
เราต้องการนำโมเดล pre-trained จาก Hugging Face มา fine-tune ด้วยข้อมูลจากทีม support ของบริษัท เพื่อช่วยจำแนกการโต้ตอบกับลูกค้าตามความเสี่ยงในการเลิกใช้บริการ (churn) ซึ่งจะช่วยให้ทีมสามารถจัดลำดับความสำคัญและรับมือกับปัญหาได้อย่างมีประสิทธิภาพมากขึ้น
เตรียมข้อมูล training และ test สำหรับการ fine-tuning ด้วยการ tokenize ข้อความ
ข้อมูล AutoTokenizer และ AutoModelForSequenceClassification ได้ถูกโหลดไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Python เบื้องต้นสำหรับ LLMs
คำแนะนำการฝึกหัด
- โหลดโมเดล pre-trained และ tokenizer เพื่อเตรียมพร้อมสำหรับการ fine-tuning
- Tokenize ทั้ง
train_data["interaction"]และtest_data["interaction"]โดยเปิดใช้งาน padding และการตัดทอนลำดับ (truncation)
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)