開始使用免費開始

分析維度與前處理

在這個練習中,你已經拿到 lem_corpus,其中包含上一個練習中的電影宣傳標語經過前處理後的版本。換句話說,這些標語已轉為小寫並做了詞形還原,且已移除停用詞。

你的任務是為這些詞形還原後的標語產生詞袋表示 bow_lem_matrix,並將其形狀與你在上一個練習得到的 bow_matrix 進行比較。lem_corpus 中前 5 筆詞形還原後的標語已經印到主控台,方便你檢視。

本練習屬於課程

Python 中文本特徵工程

檢視課程

練習說明

  • sklearn 匯入 CountVectorizer 類別。
  • 建立一個 CountVectorizer 物件,命名為 vectorizer
  • 使用 fit_transform(),為 lem_corpus 產生 bow_lem_matrix

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
編輯並執行程式碼