统计词频(I)
记录完高层信息后,您就可以开始基于文本的实际内容来创建特征。一个方法是借鉴前面课程处理中类别变量的思路。
- 对数据集中每个唯一词语创建一列。
- 对每条记录,统计该词语出现的次数,并将计数填入相应的列中。
这些"计数"列随后可用于训练机器学习模型。
本练习是课程的一部分
Python 中的机器学习特征工程
练习说明
- 从
sklearn.feature_extraction.text导入CountVectorizer。 - 实例化
CountVectorizer,并将其赋给cv。 - 将向量化器拟合到
text_clean列。 - 打印向量化器生成的特征名称。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import CountVectorizer
____
# Instantiate CountVectorizer
cv = ____
# Fit the vectorizer
cv.____(speech_df['text_clean'])
# Print feature names
print(cv.____)