開始使用免費開始

電影評論的 BoW 向量

在這個練習中,你拿到兩個 pandas 的 Series:X_trainX_test,其中包含電影評論。它們分別代表訓練用與測試用的評論資料。你的任務是先對評論做前處理,並使用 CountVectorizer 為這兩個資料集產生 BoW 向量。

一旦建立好 BoW 向量矩陣 X_train_bowX_test_bow,我們就能很順利地套用機器學習模型,進行情感分析。

本練習屬於課程

Python 中文本特徵工程

檢視課程

練習說明

  • sklearn 函式庫匯入 CountVectorizer
  • 建立一個名為 vectorizerCountVectorizer 物件。設定將所有單字轉為小寫,並移除 english 停用詞。
  • X_train 來擬合 vectorizer,接著用它轉換 X_train,產生 BoW 向量集合 X_train_bow
  • 使用 vectorizer 轉換 X_test,產生 BoW 向量集合 X_test_bow

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)

# Fit and transform X_train
X_train_bow = vectorizer.____(____)

# Transform X_test
X_test_bow = vectorizer.____(____)

# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)
編輯並執行程式碼