Bắt đầu ngayBắt đầu miễn phí

Tách token văn bản với AutoTokenizer

AutoTokenizer giúp đơn giản hóa bước chuẩn bị văn bản bằng cách tự động xử lý làm sạch, chuẩn hóa và tách token. Công cụ này đảm bảo văn bản được xử lý đúng như mô hình mong đợi.

Trong bài tập này, bạn sẽ khám phá cách AutoTokenizer biến văn bản thành các token sẵn sàng cho các tác vụ Machine Learning.

Bài tập này là một phần của khóa học

Làm việc với Hugging Face

Xem khóa học

Hướng dẫn bài tập

  • Import lớp cần thiết từ transformers, load tokenizer bằng phương thức phù hợp, và tách văn bản đầu vào thành các token.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import necessary library for tokenization
from transformers import ____

# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")

# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")

# Display the tokenized output
print(f"Tokenized output: {tokens}")
Chỉnh sửa và Chạy Mã