開始使用免費開始

建立口語文字分類器

你已經把一些客服來電的音訊轉成文字了,接下來要建立一個模型,把這些通話文字分類為 pre_purchasepost_purchase

我們有 45 筆 pre_purchase 通話範例,以及 57 筆 post_purchase 通話範例。

用來訓練模型的資料存放在 train_df,而要做預測的資料則在 test_df

先試著在主控台列印每個資料框的 .head() 看看。

我們會建立一個 sklearn pipeline,用 CountVectorizer()TfidfTransformer() 把文字樣本轉成數值,再用 MultinomialNB() 分類器學習每個樣本屬於哪個類別。

這個模型在我們的小型範例上表現不錯,但如果文字量更大,你可能需要考慮更進階的方法。

本練習屬於課程

Python 的口語語言處理

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
    ('vectorizer', ____),
    ('tfidf', ____),
    ('classifier', ____),
])

# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)
編輯並執行程式碼