开始使用免费开始使用

Tf-idf

虽然词频计数对构建模型有用,但出现次数非常多的词可能会让结果产生不理想的偏斜。为了防止这些常见词主导您的模型,可以使用一种归一化方法。在本节中,您将使用在视频中介绍的词频-逆文档频率(Tf-idf)。Tf-idf 的效果是:降低常见词的权重,同时提升那些在多数文档中并不常见的词的权重。

本练习是课程的一部分

Python 中的机器学习特征工程

查看课程

练习说明

  • sklearn.feature_extraction.text 导入 TfidfVectorizer
  • 实例化 TfidfVectorizer,将特征数量限制为 100,并移除英文停用词。
  • 在一步中对 text_clean 列拟合并应用该向量化器。
  • 创建一个包含词权重的 DataFrame tv_df,并将特征名称作为列名。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import TfidfVectorizer
____

# Instantiate TfidfVectorizer
tv = ____

# Fit the vectroizer and transform the data
tv_transformed = ____(speech_df['text_clean'])

# Create a DataFrame with these features
tv_df = pd.DataFrame(tv_transformed.____, 
                     columns=tv.____).add_prefix('TFIDF_')
print(tv_df.head())
编辑并运行代码