テキストデータセットをトークナイズする
旅行サイト向けの市場調査に取り組んでおり、ホテルのレビューを分類するモデルをファインチューニングするために既存のデータセットを使いたいと考えています。ここでは datasets ライブラリを使用します。
transformers から AutoTokenizer クラスが、datasets から load_dataset() がすでにインポートされています。
この演習はコースの一部です
人間のフィードバックによる強化学習(RLHF)
演習の手順
- テキストを同じサイズのバッチで処理できるよう、tokenizer にパディングを追加します。
- 事前学習済みの GPT 用 tokenizer と定義済みの関数を使ってテキストデータをトークナイズします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
dataset = load_dataset("argilla/tripadvisor-hotel-reviews")
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Add padding with the pad token
tokenizer.____
def tokenize_function(examples):
return tokenizer(examples["text"], padding="max_length", truncation=True)
# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)