您的第一个 BOW
Bag-of-words(词袋)是一种将文本转换为数值形式的方法。
在本练习中,您将先对列表 annak 应用 BOW,然后在下一个练习中再处理更大的数据集。
您的任务是使用这个列表,并通过 CountVectorizer() 应用 BOW。这个转换是理解文本情感的第一步。请留意那些可能带有强烈情感色彩的词语。
请记住,CountVectorizer() 的输出是稀疏矩阵,只存储非零条目。若要查看该矩阵的实际内容,可使用 .toarray() 方法将其转换为稠密数组。
注意,在这个例子中由于文本很短,您不需要指定 max_features 参数。
本练习是课程的一部分
Python 中的情感分析
练习说明
- 从
sklearn.feature_extraction.text导入计数向量器函数。 - 在这个小数据集上构建并拟合向量器。
- 调用
transform()方法创建名为anna_bow的 BOW 表示。 - 以稠密数组的形式打印 BOW 结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)
# Create the bow representation
anna_bow = anna_vect.____(annak)
# Print the bag-of-words result
print(anna_bow.toarray())