创建口语文本分类器
现在您已经把一些客服来电的音频转写为文本,我们将构建一个模型,用于判断这些来电文本是 pre_purchase 还是 post_purchase。
我们有 45 条 pre_purchase 来电样本和 57 条 post_purchase 来电样本。
用于训练模型的数据保存在 train_df,用于预测的数据保存在 test_df。
请尝试在控制台打印它们各自的 .head()。
我们将构建一个 sklearn pipeline,使用 CountVectorizer() 和 TfidfTransformer() 将文本样本转换为数值表示,然后用 MultinomialNB() 分类器学习每个样本所属的类别。
该模型在我们这个小示例中效果良好,但如果文本量更大,您可能需要考虑更复杂的方法。
本练习是课程的一部分
Python 语音语言处理
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
('vectorizer', ____),
('tfidf', ____),
('classifier', ____),
])
# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)