建立並評估模型:電影評論
在這題中,你要使用 movies 資料集建立一個邏輯斯迴歸模型。分數儲存在 label 欄位,評論為正向時為 1,負向時為 0。文字評論已用 BOW 轉換為數值欄位。
你之前已建立過分類器,但評估時使用了與訓練相同的資料。這次請務必用未看過的測試資料集來評估模型。當在測試集上評估時,模型的效能有何變化?
本練習屬於課程
Python 情感分析
練習說明
- 匯入用於進行訓練/測試集切分的函式。
- 進行訓練/測試集切分,指定 20% 的資料作為測試集。
- 訓練一個邏輯斯迴歸模型。
- 分別印出模型在訓練資料與測試資料上的準確率。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import the required packages
from sklearn.linear_model import LogisticRegression
____
# Define the vector of labels and matrix of features
y = movies.label
X = movies.drop('label', axis=1)
# Perform the train-test split
X_train, X_test, y_train, y_test = ____(X, y, ____=0.2, random_state=42)
# Build a logistic regression model and print out the accuracy
log_reg = ____.____
print('Accuracy on train set: ', log_reg.____(____, ____))
print('Accuracy on test set: ', log_reg.____(____, ____))