查找最常见的词
在创建好特征后,最好先检查一下,确认结果是否符合预期。这样可以及早发现错误,也能影响您接下来的特征工程思路。
上一个练习中您拟合的向量化器 (cv) 以及由词频构成的稀疏数组 (cv_trigram) 已在您的工作区中可用。
本练习是课程的一部分
Python 中的机器学习特征工程
练习说明
- 创建一个包含特征(词频)的 DataFrame。
- 汇总词出现的次数,并打印出现次数最多的前 5 个词。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a DataFrame of the features
cv_tri_df = ____(____,
columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')
# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())