テキストのトークナイズ
Hugging Face の事前学習済みモデルを活用し、自社のサポートチームのデータでファインチューニングして、解約リスクに応じてやり取りを分類したいとします。これにより、どれを優先して、どのように対応すべきかを判断しやすくなり、より能動的なサポートが可能になります。
テキストをトークナイズして、ファインチューニング用の学習データとテストデータを準備しましょう。
AutoTokenizer と AutoModelForSequenceClassification はすでに読み込まれています。
この演習はコースの一部です
Pythonで学ぶ LLM 入門
演習の手順
- ファインチューニングに向けて、事前学習済みのモデルとトークナイザーを読み込みます。
train_data["interaction"]とtest_data["interaction"]の両方をトークナイズし、パディングとシーケンスの切り詰めを有効にします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)