Tf-idf
虽然词频计数对构建模型有用,但出现次数非常多的词可能会让结果产生不理想的偏斜。为了防止这些常见词主导您的模型,可以使用一种归一化方法。在本节中,您将使用在视频中介绍的词频-逆文档频率(Tf-idf)。Tf-idf 的效果是:降低常见词的权重,同时提升那些在多数文档中并不常见的词的权重。
本练习是课程的一部分
Python 中的机器学习特征工程
练习说明
- 从
sklearn.feature_extraction.text导入TfidfVectorizer。 - 实例化
TfidfVectorizer,将特征数量限制为 100,并移除英文停用词。 - 在一步中对
text_clean列拟合并应用该向量化器。 - 创建一个包含词权重的 DataFrame
tv_df,并将特征名称作为列名。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import TfidfVectorizer
____
# Instantiate TfidfVectorizer
tv = ____
# Fit the vectroizer and transform the data
tv_transformed = ____(speech_df['text_clean'])
# Create a DataFrame with these features
tv_df = pd.DataFrame(tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(tv_df.head())