Složitější baggingový model
Teď, když jsi prozkoumal/a data o polovodičích, sestavíme baggingový klasifikátor pro predikci štítku 'Pass/Fail' na základě vstupních příznaků.
Předzpracovaná datová sada je v tvém pracovním prostoru dostupná jako uci_secom a trénovací i testovací sady jsou již připravené.
Protože cílová třída je silně nevyvážená, použij jako základní estimátor logistickou regresi s parametrem "balanced".
Dobu výpočtu pro LogisticRegression zkrátíme pomocí parametru solver='liblinear', který je rychlejší než výchozí optimalizátor.
Toto cvičení je součástí kurzu
Ensemble Methods in Python
Pokyny k cvičení
- Vytvoř instanci logistické regrese jako základní klasifikátor s parametry:
class_weight='balanced',solver='liblinear'arandom_state=42. - Sestav baggingový klasifikátor s logistickou regresí jako základním estimátorem, nastav maximální počet příznaků na
10a zahrň out-of-bag skóre. - Vypiš out-of-bag skóre a porovnej ho s přesností modelu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build a balanced logistic regression
clf_lr = ____
# Build and fit a bagging classifier
clf_bag = ____(____, ____, ____, random_state=500)
clf_bag.fit(X_train, y_train)
# Evaluate the accuracy on the test set and show the out-of-bag score
pred = clf_bag.predict(X_test)
print('Accuracy: {:.2f}'.format(accuracy_score(y_test, pred)))
print('OOB-Score: {:.2f}'.format(____))
# Print the confusion matrix
print(confusion_matrix(y_test, pred))