分析維度與前處理
在這個練習中,你已經拿到 lem_corpus,其中包含上一個練習中的電影宣傳標語經過前處理後的版本。換句話說,這些標語已轉為小寫並做了詞形還原,且已移除停用詞。
你的任務是為這些詞形還原後的標語產生詞袋表示 bow_lem_matrix,並將其形狀與你在上一個練習得到的 bow_matrix 進行比較。lem_corpus 中前 5 筆詞形還原後的標語已經印到主控台,方便你檢視。
本練習屬於課程
Python 中文本特徵工程
練習說明
- 從
sklearn匯入CountVectorizer類別。 - 建立一個
CountVectorizer物件,命名為vectorizer。 - 使用
fit_transform(),為lem_corpus產生bow_lem_matrix。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)