テキストのトークン化
Hugging Face の事前学習済みモデルを活用し、サポートチームのデータでファインチューニングすることで、顧客離れ(チャーン)のリスクに応じてやり取りを分類するモデルを作ります。これにより、チームは優先すべき対応を判断し、どう対応すべきかを把握できるようになり、より能動的に動けるようになります。
ファインチューニング用のトレーニングデータとテストデータを準備するために、テキストをトークン化しましょう。
AutoTokenizer と AutoModelForSequenceClassification はすでに読み込まれています。
この演習はコースの一部です
Python で学ぶ LLM の入門
演習の手順
- ファインチューニングの準備として、事前学習済みモデルとトークナイザーを読み込みます。
train_data["interaction"]とtest_data["interaction"]の両方をトークン化し、パディングとシーケンスの切り捨てを有効にします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)