開始使用免費開始

Twitter 資料的效能指標

你將訓練一個邏輯斯迴歸模型,用來預測推文的情緒,並以不同的指標在測試集上評估其表現。

已為你建立好矩陣 X,其中包含以 text 欄位透過 BOW 建立的特徵。

標籤儲存在名為 y 的向量中。向量 y 中,負向推文為 0,中立為 1,正向為 2。 請注意,雖然有 3 個類別,這仍是分類問題。Accuracy 仍然衡量正確預測的比例。此時混淆矩陣會是 3x3 的大小,每一列給出針對類別 2、1、0 的「預測」個數;每一欄則是類別 2、1、0 的「真實」個數。

所有需要的套件都已為你匯入。

本練習屬於課程

Python 情感分析

檢視課程

練習說明

  • 進行訓練/測試切分,並以 y 進行分層(stratify)。
  • 訓練一個邏輯斯迴歸分類器。
  • 在測試集上進行預測並評估表現。
  • 列印在測試集上得到的 accuracy 分數與混淆矩陣。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Split the data into training and testing sets
X_train, X_test, y_train, y_test = ____(X, y, test_size=0.3, random_state=123, ____=y)

# Train a logistic regression
log_reg = ____.____(___, ____)

# Make predictions on the test set
y_predicted = log_reg.____(___)

# Print the performance metrics
print('Accuracy score test set: ', ____(y_test, y_predicted))
print('Confusion matrix test set: \n', ____(y_test, y_predicted)/len(y_test))
編輯並執行程式碼