步驟 3:建立分類器
這是情緒分析預測的最後一步。我們已經探索並以與情緒相關的特徵來強化資料集,並將其轉成數值向量。
你將使用在前面步驟中建立的資料集。它包含 1 個評論長度的特徵,以及透過 Tfidf 向量器所建立的 200 個特徵。
你的任務是訓練一個羅吉斯回歸來預測情緒。資料已為你匯入,名稱為 reviews_transformed。目標變數為 score,且是二元的:產品評論為正向時為 1,否則為 0。
訓練羅吉斯回歸模型,並在測試資料上評估其表現。模型效果如何?
所有需要的套件都已為你匯入。
本練習屬於課程
Python 情感分析
練習說明
- 進行訓練/測試分割,將 20% 的資料用於測試,並將隨機種子設為
456。 - 訓練一個羅吉斯回歸模型。
- 預測類別。
- 印出測試集的 accuracy 分數與混淆矩陣。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)
# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)
# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)
# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))