開始使用免費開始

對文字資料集進行分詞

你正在為一個旅遊網站進行情境調查,想利用現有的資料集來微調模型,以協助你分類飯店評論。你決定使用 datasets 函式庫。

AutoTokenizer 類別已從 transformers 預先匯入,load_dataset() 也已從 datasets 預先匯入。

本練習屬於課程

Reinforcement Learning from Human Feedback(RLHF)

檢視課程

練習說明

  • 為 tokenizer 加上 padding,以便將文字處理為同大小的批次。
  • 使用預訓練的 GPT tokenizer 與已定義的函式來對文字資料進行分詞。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
編輯並執行程式碼