用特征名映射特征索引
在课程视频中,我们看到 CountVectorizer 不一定按字母顺序为词汇表建立索引。在本练习中,您将学习如何把每个特征索引映射到词汇表中对应的特征名。
我们将使用视频中的关于狮子的 3 个句子。这些句子已放在名为 corpus 的列表中,并且已经打印到控制台。
本练习是课程的一部分
Python 中的 NLP 特征工程
练习说明
- 实例化一个
CountVectorizer对象,命名为vectorizer。 - 使用
fit_transform(),为corpus生成bow_matrix。 - 使用
get_feature_names()方法,将列名映射到词汇表中对应的单词。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)