始める無料で始める

マッピングトークン化

ここでは、トークナイゼーションをより細かく制御する方法を試してみましょう。データを行単位またはバッチ単位でトークナイズする方法を確認します。この処理により、トレーニングに必要な DataSet オブジェクトとして結果を取得できます。

tokenizer はあらかじめ読み込まれており、データは train_datatest_data として利用できます。

この演習はコースの一部です

Python で学ぶ LLM の入門

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Complete the function
def tokenize_function(data):
    return tokenizer(data["interaction"], 
                     ____, 
                     padding=True, 
                     ____, 
                     max_length=64)

tokenized_in_batches = ____
コードを編集して実行