對文字資料集進行分詞
你正在為一個旅遊網站進行情境調查,想利用現有的資料集來微調模型,以協助你分類飯店評論。你決定使用 datasets 函式庫。
AutoTokenizer 類別已從 transformers 預先匯入,load_dataset() 也已從 datasets 預先匯入。
本練習屬於課程
Reinforcement Learning from Human Feedback(RLHF)
練習說明
- 為 tokenizer 加上 padding,以便將文字處理為同大小的批次。
- 使用預訓練的 GPT tokenizer 與已定義的函式來對文字資料進行分詞。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
dataset = load_dataset("argilla/tripadvisor-hotel-reviews")
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Add padding with the pad token
tokenizer.____
def tokenize_function(examples):
return tokenizer(examples["text"], padding="max_length", truncation=True)
# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)