GBM を使った感情分析
reviews データセットに対して、scikit-learn の GradientBoostingClassifier を使い、テキストからレビューの感情を予測してみましょう。
モデルへの入力として生のテキストは渡しません。以下の前処理はあらかじめ実施済みです。
- 欠損のあるレビューを削除。
- 上位5つのアプリのデータを選択。
- レビューをランダムに500件サブサンプリング。
- レビューから「ストップワード」を除去。
- レビューを行列に変換(各特徴量はレビュー内の単語の出現頻度を表します)。
テキストマイニングをもっと深く学びたい方は、Introduction to Natural Language Processing in Python のコースもぜひご覧ください!
この演習はコースの一部です
Pythonで学ぶアンサンブル手法
演習の手順
100個の推定器と0.1の学習率を持つGradientBoostingClassifierを作成します。- テストセットで予測を計算します。
- モデルを評価するために正解率を算出します。
- 混同行列を計算して出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))
# Get and show the Confusion Matrix
cm = ____
print(cm)