マッピングトークン化
ここでは、トークナイゼーションをより細かく制御する方法を試してみましょう。データを行単位またはバッチ単位でトークナイズする方法を確認します。この処理により、トレーニングに必要な DataSet オブジェクトとして結果を取得できます。
tokenizer はあらかじめ読み込まれており、データは train_data と test_data として利用できます。
この演習はコースの一部です
Python で学ぶ LLM の入門
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Complete the function
def tokenize_function(data):
return tokenizer(data["interaction"],
____,
padding=True,
____,
max_length=64)
tokenized_in_batches = ____