Začněte nyníZačněte zdarma

Předpovídání úmrtí v GoT

Cílová proměnná sice neobsahuje žádné chybějící hodnoty, jiné příznaky ale ano. Protože se tento kurz nezaměřuje na čištění a předzpracování dat, postarali jsme se o následující kroky za tebe:

  • Hodnoty NA byly nahrazeny hodnotou 0.
  • Záporné hodnoty věku byly nahrazeny hodnotou 0.
  • Hodnoty NA věku byly nahrazeny průměrem.

Teď sestavíme ensemble model pomocí techniky průměrování. Byly připraveny tyto individuální modely:

  • Logistická regrese (clf_lr).
  • Rozhodovací strom (clf_dt).
  • Metoda podpůrných vektorů (clf_svm).

Protože je cílová proměnná binární, mohou mít všechny tyto modely dobré individuální výsledky. Tvým úkolem je zkombinovat je pomocí průměrování. Vzpomeň si z videa, že to je totéž jako přístup soft votingu – proto stále použiješ VotingClassifier().

Toto cvičení je součástí kurzu

Ensemble Methods in Python

Zobrazit kurz

Pokyny k cvičení

  • Sestav seznam tuplů ve formátu (řetězec, estimátor). Použij 'lr' pro clf_lr, 'dt' pro clf_dt a 'svm' pro clf_svm.
  • Sestav průměrovací klasifikátor s názvem clf_avg. Nezapomeň zadat argument pro parametr voting.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Build the individual models
clf_lr = LogisticRegression(class_weight='balanced')
clf_dt = DecisionTreeClassifier(min_samples_leaf=3, min_samples_split=9, random_state=500)
clf_svm = SVC(probability=True, class_weight='balanced', random_state=500)

# List of (string, estimator) tuples
estimators = ____

# Build and fit an averaging classifier
clf_avg = ____
clf_avg.fit(X_train, y_train)

# Evaluate model performance
acc_avg = accuracy_score(y_test,  clf_avg.predict(X_test))
print('Accuracy: {:.2f}'.format(acc_avg))
Upravit a spustit kód