开始使用免费开始使用

创建口语文本分类器

现在您已经把一些客服来电的音频转写为文本,我们将构建一个模型,用于判断这些来电文本是 pre_purchase 还是 post_purchase

我们有 45 条 pre_purchase 来电样本和 57 条 post_purchase 来电样本。

用于训练模型的数据保存在 train_df,用于预测的数据保存在 test_df

请尝试在控制台打印它们各自的 .head()

我们将构建一个 sklearn pipeline,使用 CountVectorizer()TfidfTransformer() 将文本样本转换为数值表示,然后用 MultinomialNB() 分类器学习每个样本所属的类别。

该模型在我们这个小示例中效果良好,但如果文本量更大,您可能需要考虑更复杂的方法。

本练习是课程的一部分

Python 语音语言处理

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
    ('vectorizer', ____),
    ('tfidf', ____),
    ('classifier', ____),
])

# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)
编辑并运行代码