開始使用免費開始

文字分詞(Tokenization)

你想利用 Hugging Face 上的預訓練模型,並結合公司客服團隊的資料進行微調,用來依據可能流失(churn)的風險來分類互動內容。這能幫助團隊決定優先處理哪些案例,以及應該如何處理,讓行動更主動。

請先將文字做分詞,為微調準備訓練與測試資料。

AutoTokenizerAutoModelForSequenceClassification 已為你載入。

本練習屬於課程

Python 的 LLM 入門

檢視課程

練習說明

  • 載入預訓練模型與分詞器,為微調作準備。
  • train_data["interaction"]test_data["interaction"] 進行分詞,並啟用 padding 與序列截斷(truncation)。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
編輯並執行程式碼