スパム分類器の学習
SMS データは分類器の構築に向けて前処理が完了しています。ここまでで実施した内容は次のとおりです。
- 数字と句読点の除去
- メッセージを単語(「トークン」)へ分割
- ストップワードの除去
- ハッシングトリックの適用
- TF-IDF への変換
次に、TF-IDF データを学習用とテスト用に分割します。その後、学習データで Logistic Regression モデルを学習し、最後にテストデータでその性能を評価します。
データは sms に格納されており、LogisticRegression はすでにインポート済みです。
この演習はコースの一部です
Machine Learning with PySpark
演習の手順
- データを 4:1 の比率で学習用とテスト用に分割します。再現性のため乱数シードを 13 に設定します。
LogisticRegressionオブジェクトを作成し、学習データに適合させます。- テストデータに対する予測を生成します。
- 予測結果を用いて混同行列を作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Split the data into training and testing sets
sms_train, sms_test = sms.____(____, ____)
# Fit a Logistic Regression model to the training data
logistic = ____(regParam=0.2).____(____)
# Make predictions on the testing data
prediction = logistic.____(____)
# Create a confusion matrix, comparing predictions to known labels
prediction.groupBy(____, ____).____().____()