Tokenize văn bản
Bạn muốn tận dụng một mô hình đã được huấn luyện sẵn từ Hugging Face và fine-tune nó với dữ liệu từ đội ngũ hỗ trợ của công ty để phân loại các tương tác theo rủi ro rời bỏ (churn). Điều này sẽ giúp đội ngũ ưu tiên xử lý việc gì trước và xử lý như thế nào, từ đó chủ động hơn.
Hãy chuẩn bị dữ liệu huấn luyện và kiểm tra cho quá trình fine-tune bằng cách tokenize văn bản.
Các đối tượng AutoTokenizer và AutoModelForSequenceClassification đã được tải sẵn cho bạn.
Bài tập này là một phần của khóa học
Nhập môn LLMs trong Python
Hướng dẫn bài tập
- Tải mô hình và tokenizer đã được huấn luyện sẵn để chuẩn bị cho việc fine-tune.
- Tokenize cả
train_data["interaction"]vàtest_data["interaction"], bật padding và cắt ngắn chuỗi (sequence truncation).
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)