トークナイズのマッピング
トークナイズをより細かく制御できるか試すために、行単位またはバッチ単位でデータをトークナイズしてみましょう。これにより、学習で必要となる DataSet オブジェクトの結果も得られます。
tokenizer は、train_data と test_data というデータと一緒に読み込まれています。
この演習はコースの一部です
Pythonで学ぶ LLM 入門
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Complete the function
def tokenize_function(data):
return tokenizer(data["interaction"],
____,
padding=True,
____,
max_length=64)
tokenized_in_batches = ____