AutoTokenizerを使ったテキストのトークン化
AutoTokenizerは、テキストのクリーニング、正規化、トークン化を自動で処理し、テキストの前処理を簡略化できます。これにより、テキストがモデルの想定通りに処理されるようになります。
この演習では、AutoTokenizerがテキストを機械学習タスクに対応したトークンに変換する仕組みを見ていきましょう。
この演習はコースの一部です
Hugging Faceを使いこなす
演習の手順
transformersから必要なクラスをインポートし、正しいメソッドを使ってトークナイザーを読み込み、入力テキストをトークンに分割します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import necessary library for tokenization
from transformers import ____
# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")
# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")
# Display the tokenized output
print(f"Tokenized output: {tokens}")