始める無料で始める

AutoTokenizerを使ったテキストのトークン化

AutoTokenizerは、テキストのクリーニング、正規化、トークン化を自動で処理し、テキストの前処理を簡略化できます。これにより、テキストがモデルの想定通りに処理されるようになります。

この演習では、AutoTokenizerがテキストを機械学習タスクに対応したトークンに変換する仕組みを見ていきましょう。

この演習はコースの一部です

Hugging Faceを使いこなす

コースを見る

演習の手順

  • transformersから必要なクラスをインポートし、正しいメソッドを使ってトークナイザーを読み込み、入力テキストをトークンに分割します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import necessary library for tokenization
from transformers import ____

# Load the tokenizer
tokenizer = AutoTokenizer.____("distilbert-base-uncased-finetuned-sst-2-english")

# Split input text into tokens
tokens = tokenizer.____("AI: Making robots smarter and humans lazier!")

# Display the tokenized output
print(f"Tokenized output: {tokens}")
コードを編集して実行