建立口語文字分類器
你已經把一些客服來電的音訊轉成文字了,接下來要建立一個模型,把這些通話文字分類為 pre_purchase 或 post_purchase。
我們有 45 筆 pre_purchase 通話範例,以及 57 筆 post_purchase 通話範例。
用來訓練模型的資料存放在 train_df,而要做預測的資料則在 test_df。
先試著在主控台列印每個資料框的 .head() 看看。
我們會建立一個 sklearn pipeline,用 CountVectorizer() 與 TfidfTransformer() 把文字樣本轉成數值,再用 MultinomialNB() 分類器學習每個樣本屬於哪個類別。
這個模型在我們的小型範例上表現不錯,但如果文字量更大,你可能需要考慮更進階的方法。
本練習屬於課程
Python 的口語語言處理
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
('vectorizer', ____),
('tfidf', ____),
('classifier', ____),
])
# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)