適合率と再現率を計算する
sklearn.metrics サブモジュールには、さまざまな指標を簡単に計算できる関数が多数用意されています。ここまでは、直感を養うために適合率(precision)と再現率(recall)を手計算してきました。
実務では、その直感がつかめたら、適合率と再現率を自動で計算する precision_score と recall_score を活用できます。どちらも sklearn.metrics の他の関数と同様に動作し、2つの引数を取ります。1つ目は実際のラベル(y_test)、2つ目は予測ラベル(y_pred)です。
それでは、学習用データの割合を90%にして試してみましょう。
この演習はコースの一部です
マーケティングアナリティクス:Pythonで顧客解約を予測する
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import train_test_split
from sklearn.model_selection import train_test_split
# Create feature variable
X = telco.drop('Churn', axis=1)
# Create target variable
y = telco['Churn']
# Create training and testing sets
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.1)
# Import RandomForestClassifier
from sklearn.ensemble import RandomForestClassifier
# Instantiate the classifier
clf = RandomForestClassifier()
# Fit to the training data
clf.fit(X_train, y_train)
# Predict the labels of the test set
y_pred = clf.predict(X_test)
# Import precision_score