始める無料で始める

テキストのトークナイズ

Hugging Face の事前学習済みモデルを活用し、自社のサポートチームのデータでファインチューニングして、解約リスクに応じてやり取りを分類したいとします。これにより、どれを優先して、どのように対応すべきかを判断しやすくなり、より能動的なサポートが可能になります。

テキストをトークナイズして、ファインチューニング用の学習データとテストデータを準備しましょう。

AutoTokenizerAutoModelForSequenceClassification はすでに読み込まれています。

この演習はコースの一部です

Pythonで学ぶ LLM 入門

コースを見る

演習の手順

  • ファインチューニングに向けて、事前学習済みのモデルとトークナイザーを読み込みます。
  • train_data["interaction"]test_data["interaction"] の両方をトークナイズし、パディングとシーケンスの切り詰めを有効にします。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
コードを編集して実行