開始使用免費開始

使用 AutoTokenizer 前處理文字

你正在打造一個精準農業應用,讓農民能就田間遇到的問題提出問題並獲得解答。你會利用一個包含常見問題與解答的資料集;其中欄位為:

  • question:常見的農業問題
  • answers:對應農業問題的解答

作為分散式訓練的第一步,你將先前處理這個文字資料集。

部分資料已預先載入:

  • dataset 包含一個農業問答的範例資料集
  • 已從 transformers 匯入 AutoTokenizer

本練習屬於課程

使用 PyTorch 高效訓練 AI 模型

檢視課程

練習說明

  • 載入一個預訓練的 tokenizer
  • 使用 tokenizerexample["question"] 進行分詞與編碼。
  • encode() 函式套用到 dataset

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")

def encode(example):
    # Tokenize the "question" field of the training example
    return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")

# Map the function to the dataset
dataset = ____.____(____, batched=True)

dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)

print(dataset)
編輯並執行程式碼