電影評論的 BoW 向量
在這個練習中,你拿到兩個 pandas 的 Series:X_train 與 X_test,其中包含電影評論。它們分別代表訓練用與測試用的評論資料。你的任務是先對評論做前處理,並使用 CountVectorizer 為這兩個資料集產生 BoW 向量。
一旦建立好 BoW 向量矩陣 X_train_bow 與 X_test_bow,我們就能很順利地套用機器學習模型,進行情感分析。
本練習屬於課程
Python 中文本特徵工程
練習說明
- 從
sklearn函式庫匯入CountVectorizer。 - 建立一個名為
vectorizer的CountVectorizer物件。設定將所有單字轉為小寫,並移除english停用詞。 - 以
X_train來擬合vectorizer,接著用它轉換X_train,產生 BoW 向量集合X_train_bow。 - 使用
vectorizer轉換X_test,產生 BoW 向量集合X_test_bow。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)