始める無料で始める

GBM を使った感情分析

reviews データセットに対して、scikit-learnGradientBoostingClassifier を使い、テキストからレビューの感情を予測してみましょう。

モデルへの入力として生のテキストは渡しません。以下の前処理はあらかじめ実施済みです。

  1. 欠損のあるレビューを削除。
  2. 上位5つのアプリのデータを選択。
  3. レビューをランダムに500件サブサンプリング。
  4. レビューから「ストップワード」を除去。
  5. レビューを行列に変換(各特徴量はレビュー内の単語の出現頻度を表します)。

テキストマイニングをもっと深く学びたい方は、Introduction to Natural Language Processing in Python のコースもぜひご覧ください!

この演習はコースの一部です

Pythonで学ぶアンサンブル手法

コースを見る

演習の手順

  • 100 個の推定器と 0.1 の学習率を持つ GradientBoostingClassifier を作成します。
  • テストセットで予測を計算します。
  • モデルを評価するために正解率を算出します。
  • 混同行列を計算して出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)
コードを編集して実行