开始使用免费开始使用

您的第一个 BOW

Bag-of-words(词袋)是一种将文本转换为数值形式的方法。

在本练习中,您将先对列表 annak 应用 BOW,然后在下一个练习中再处理更大的数据集。

您的任务是使用这个列表,并通过 CountVectorizer() 应用 BOW。这个转换是理解文本情感的第一步。请留意那些可能带有强烈情感色彩的词语。

请记住,CountVectorizer() 的输出是稀疏矩阵,只存储非零条目。若要查看该矩阵的实际内容,可使用 .toarray() 方法将其转换为稠密数组。

注意,在这个例子中由于文本很短,您不需要指定 max_features 参数。

本练习是课程的一部分

Python 中的情感分析

查看课程

练习说明

  • sklearn.feature_extraction.text 导入计数向量器函数。
  • 在这个小数据集上构建并拟合向量器。
  • 调用 transform() 方法创建名为 anna_bow 的 BOW 表示。
  • 以稠密数组的形式打印 BOW 结果。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import the required function
____

annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']

# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)

# Create the bow representation
anna_bow = anna_vect.____(annak)

# Print the bag-of-words result 
print(anna_bow.toarray())
编辑并运行代码