開始使用免費開始

使用 AutoTokenizer 進行文字分詞

AutoTokenizer 可自動處理清理、正規化與分詞,讓文字前處理更簡化。它能確保文字的處理方式符合模型的預期。

在這個練習中,你將探索 AutoTokenizer 如何把文字轉換成可用於機器學習工作的 token。

本練習屬於課程

善用 Hugging Face

檢視課程

練習說明

  • 匯入 transformers 中需要的類別,載入正確的方法來建立 tokenizer,並將輸入文字切分為 token。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import necessary library for tokenization
from transformers import ____

# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")

# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")

# Display the tokenized output
print(f"Tokenized output: {tokens}")
編輯並執行程式碼