Metriky výkonu pro model RF
V předchozích cvičeních jsi pro svůj model náhodného lesa získal/a skóre přesnosti. Teď ale víme, že přesnost může být v případě detekce podvodů zavádějící. U silně nevyvážených dat je křivka AUROC spolehlivější metrikou výkonu, která umožňuje porovnávat různé klasifikátory. Klasifikační zpráva ti navíc ukáže přesnost (precision) a úplnost (recall) modelu, zatímco matice záměn přehledně zobrazí, kolik případů podvodů model správně odhalí. Pojďme si tedy tyto metriky výkonu získat.
Budeme pokračovat se stejným modelem náhodného lesa z předchozího cvičení. Model definovaný jako model = RandomForestClassifier(random_state=5) je už natrénovaný na trénovacích datech a k dispozici máš X_train, y_train, X_test, y_test.
Toto cvičení je součástí kurzu
Detekce podvodů v Pythonu
Pokyny k cvičení
- Importuj klasifikační zprávu, matici záměn a ROC skóre z
sklearn.metrics. - Získej binární predikce z natrénovaného modelu náhodného lesa
model. - Získej predikované pravděpodobnosti pomocí funkce
predict_proba(). - Vypočítej klasifikační zprávu a matici záměn porovnáním
y_testspredicted.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the packages to get the different performance metrics
from sklearn.metrics import ____, ____, ____
# Obtain the predictions from our random forest model
predicted = model.____(X_test)
# Predict probabilities
probs = ____.____(X_test)
# Print the ROC curve, classification report and confusion matrix
print(____(y_test, probs[:,1]))
print(____(____, predicted))
print(____(____, ____))