以特徵名稱對應特徵索引
在課程影片中,我們看到 CountVectorizer 不一定會依字母順序為詞彙建立索引。這個練習中,你會學到如何把每個特徵索引,對應到詞彙表中的特徵名稱。
我們會使用影片中的同三個有關獅子的句子。這些句子已放在名為 corpus 的清單中,並已經列印到主控台。
本練習屬於課程
Python 中文本特徵工程
練習說明
- 建立一個
CountVectorizer物件,命名為vectorizer。 - 使用
fit_transform(),為corpus產生bow_matrix。 - 使用
get_feature_names()方法,將欄名對應到詞彙表中的相應單字。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)