Bắt đầu ngayBắt đầu miễn phí

Tokenize văn bản

Bạn muốn tận dụng một mô hình đã được huấn luyện sẵn từ Hugging Face và fine-tune nó với dữ liệu từ đội ngũ hỗ trợ của công ty để phân loại các tương tác theo rủi ro rời bỏ (churn). Điều này sẽ giúp đội ngũ ưu tiên xử lý việc gì trước và xử lý như thế nào, từ đó chủ động hơn.

Hãy chuẩn bị dữ liệu huấn luyện và kiểm tra cho quá trình fine-tune bằng cách tokenize văn bản.

Các đối tượng AutoTokenizerAutoModelForSequenceClassification đã được tải sẵn cho bạn.

Bài tập này là một phần của khóa học

Nhập môn LLMs trong Python

Xem khóa học

Hướng dẫn bài tập

  • Tải mô hình và tokenizer đã được huấn luyện sẵn để chuẩn bị cho việc fine-tune.
  • Tokenize cả train_data["interaction"]test_data["interaction"], bật padding và cắt ngắn chuỗi (sequence truncation).

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
Chỉnh sửa và Chạy Mã