开始使用免费开始使用

查找最常见的词

在创建好特征后,最好先检查一下,确认结果是否符合预期。这样可以及早发现错误,也能影响您接下来的特征工程思路。

上一个练习中您拟合的向量化器 (cv) 以及由词频构成的稀疏数组 (cv_trigram) 已在您的工作区中可用。

本练习是课程的一部分

Python 中的机器学习特征工程

查看课程

练习说明

  • 创建一个包含特征(词频)的 DataFrame。
  • 汇总词出现的次数,并打印出现次数最多的前 5 个词。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create a DataFrame of the features
cv_tri_df = ____(____, 
                 columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')

# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())
编辑并运行代码