使用 AutoTokenizer 前處理文字
你正在打造一個精準農業應用,讓農民能就田間遇到的問題提出問題並獲得解答。你會利用一個包含常見問題與解答的資料集;其中欄位為:
question:常見的農業問題answers:對應農業問題的解答
作為分散式訓練的第一步,你將先前處理這個文字資料集。
部分資料已預先載入:
dataset包含一個農業問答的範例資料集- 已從
transformers匯入AutoTokenizer
本練習屬於課程
使用 PyTorch 高效訓練 AI 模型
練習說明
- 載入一個預訓練的
tokenizer。 - 使用
tokenizer對example["question"]進行分詞與編碼。 - 將
encode()函式套用到dataset。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")
def encode(example):
# Tokenize the "question" field of the training example
return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")
# Map the function to the dataset
dataset = ____.____(____, batched=True)
dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)
print(dataset)