始める無料で始める

テキストデータセットをトークナイズする

旅行サイト向けの市場調査に取り組んでおり、ホテルのレビューを分類するモデルをファインチューニングするために既存のデータセットを使いたいと考えています。ここでは datasets ライブラリを使用します。

transformers から AutoTokenizer クラスが、datasets から load_dataset() がすでにインポートされています。

この演習はコースの一部です

人間のフィードバックによる強化学習(RLHF)

コースを見る

演習の手順

  • テキストを同じサイズのバッチで処理できるよう、tokenizer にパディングを追加します。
  • 事前学習済みの GPT 用 tokenizer と定義済みの関数を使ってテキストデータをトークナイズします。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
コードを編集して実行