En iyi parametreleri bulmak için GridSearchCV
Bu egzersizde modeli daha az "rastgele" bir şekilde ayarlayacak, işi senin yerine GridSearchCV'ye bırakacaksın.
GridSearchCV ile seçenekleri hangi performans metriğine göre puanlayacağını belirleyebilirsin. Fraud tespitinde amacımız çoğunlukla mümkün olduğunca çok sahtekarlığı yakalamak olduğundan, en iyi olası Recall skorunu elde etmek için model ayarlarını optimize edebilirsin. Yanlış pozitifleri azaltmayı da önemsiyorsan, F1-score üzerinde optimize edebilirsin; bu da sana güzel bir Precision-Recall dengesi sağlar.
GridSearchCV zaten sklearn.model_selection içinden içe aktarılmış durumda, hadi deneyelim!
Bu egzersiz, kursun bir parçasıdır
Python ile Sahtekarlık Tespiti
Egzersiz talimatları
- Parametre ızgarasında 1 ve 30 ağaç denemek istediğini ve
giniileentropybölme ölçütlerini deneyeceğini belirt. - Modeli basit bir RandomForestClassifier olarak tanımla; modelleri karşılaştırabilmek için
random_statedeğerini 5'te tut. scoringseçeneğini geri çağırmayı (recall) optimize edecek şekilde ayarla.- Modeli
X_trainvey_traineğitim verilerine uydur ve model için en iyi parametreleri elde et.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Define the parameter sets to test
param_grid = {'n_estimators': [____, ____], 'max_features': ['auto', 'log2'], 'max_depth': [4, 8], 'criterion': ['____', '____']
}
# Define the model to use
model = ____(random_state=5)
# Combine the parameter sets with the defined model
CV_model = GridSearchCV(estimator=model, param_grid=param_grid, cv=5, scoring='____', n_jobs=-1)
# Fit the model to our training data and obtain best parameters
CV_model.fit(____, ____)
CV_model.____