Předpovídání úmrtí v GoT
Cílová proměnná sice neobsahuje žádné chybějící hodnoty, jiné příznaky ale ano. Protože se tento kurz nezaměřuje na čištění a předzpracování dat, postarali jsme se o následující kroky za tebe:
- Hodnoty NA byly nahrazeny hodnotou
0. - Záporné hodnoty věku byly nahrazeny hodnotou
0. - Hodnoty NA věku byly nahrazeny průměrem.
Teď sestavíme ensemble model pomocí techniky průměrování. Byly připraveny tyto individuální modely:
- Logistická regrese (
clf_lr). - Rozhodovací strom (
clf_dt). - Metoda podpůrných vektorů (
clf_svm).
Protože je cílová proměnná binární, mohou mít všechny tyto modely dobré individuální výsledky.
Tvým úkolem je zkombinovat je pomocí průměrování. Vzpomeň si z videa, že to je totéž jako přístup soft votingu – proto stále použiješ VotingClassifier().
Toto cvičení je součástí kurzu
Ensemble Methods in Python
Pokyny k cvičení
- Sestav seznam tuplů ve formátu
(řetězec, estimátor). Použij'lr'proclf_lr,'dt'proclf_dta'svm'proclf_svm. - Sestav průměrovací klasifikátor s názvem
clf_avg. Nezapomeň zadat argument pro parametrvoting.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build the individual models
clf_lr = LogisticRegression(class_weight='balanced')
clf_dt = DecisionTreeClassifier(min_samples_leaf=3, min_samples_split=9, random_state=500)
clf_svm = SVC(probability=True, class_weight='balanced', random_state=500)
# List of (string, estimator) tuples
estimators = ____
# Build and fit an averaging classifier
clf_avg = ____
clf_avg.fit(X_train, y_train)
# Evaluate model performance
acc_avg = accuracy_score(y_test, clf_avg.predict(X_test))
print('Accuracy: {:.2f}'.format(acc_avg))