始める無料で始める

テキストのトークン化

Hugging Face の事前学習済みモデルを活用し、サポートチームのデータでファインチューニングすることで、顧客離れ(チャーン)のリスクに応じてやり取りを分類するモデルを作ります。これにより、チームは優先すべき対応を判断し、どう対応すべきかを把握できるようになり、より能動的に動けるようになります。

ファインチューニング用のトレーニングデータとテストデータを準備するために、テキストをトークン化しましょう。

AutoTokenizerAutoModelForSequenceClassification はすでに読み込まれています。

この演習はコースの一部です

Python で学ぶ LLM の入門

コースを見る

演習の手順

  • ファインチューニングの準備として、事前学習済みモデルとトークナイザーを読み込みます。
  • train_data["interaction"]test_data["interaction"] の両方をトークン化し、パディングとシーケンスの切り捨てを有効にします。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
コードを編集して実行