使用 AutoTokenizer 進行文字分詞
AutoTokenizer 可自動處理清理、正規化與分詞,讓文字前處理更簡化。它能確保文字的處理方式符合模型的預期。
在這個練習中,你將探索 AutoTokenizer 如何把文字轉換成可用於機器學習工作的 token。
本練習屬於課程
善用 Hugging Face
練習說明
- 匯入
transformers中需要的類別,載入正確的方法來建立 tokenizer,並將輸入文字切分為 token。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")