Tách token văn bản với AutoTokenizer
AutoTokenizer giúp đơn giản hóa bước chuẩn bị văn bản bằng cách tự động xử lý làm sạch, chuẩn hóa và tách token. Công cụ này đảm bảo văn bản được xử lý đúng như mô hình mong đợi.
Trong bài tập này, bạn sẽ khám phá cách AutoTokenizer biến văn bản thành các token sẵn sàng cho các tác vụ Machine Learning.
Bài tập này là một phần của khóa học
Làm việc với Hugging Face
Hướng dẫn bài tập
- Import lớp cần thiết từ
transformers, load tokenizer bằng phương thức phù hợp, và tách văn bản đầu vào thành các token.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")