文字分詞(Tokenization)
你想利用 Hugging Face 上的預訓練模型,並結合公司客服團隊的資料進行微調,用來依據可能流失(churn)的風險來分類互動內容。這能幫助團隊決定優先處理哪些案例,以及應該如何處理,讓行動更主動。
請先將文字做分詞,為微調準備訓練與測試資料。
AutoTokenizer 與 AutoModelForSequenceClassification 已為你載入。
本練習屬於課程
Python 的 LLM 入門
練習說明
- 載入預訓練模型與分詞器,為微調作準備。
- 對
train_data["interaction"]與test_data["interaction"]進行分詞,並啟用 padding 與序列截斷(truncation)。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)