Het beste model kiezen

In deze oefening vergelijk je verschillende classificatiemodellen en kies je het model dat het beste presteert.

De gegevensset hier — al geladen en opgesplitst in train- en testsets — bestaat uit Pokémon: hun stats, types en of ze wel of niet legendarisch zijn. Het doel van onze classifiers is om de variabele 'Legendary' te voorspellen.

Er zijn drie afzonderlijke classifiers getraind op de trainingsset:

clf_lr is een logistische regressie.
clf_dt is een beslisboom.
clf_knn is een 5-nearest neighbors-classifier.

Omdat de klassen hier uit balans zijn — slechts 65 van de 800 Pokémon in de gegevensset zijn legendarisch — gebruiken we de F1-score om de prestaties te evalueren. Scikit-learn's f1_score() is alvast voor je geïmporteerd.

Deze oefening maakt deel uit van de cursus

Ensemblemethoden in Python

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Predict the labels of the test set
pred_lr = ____
pred_dt = ____
pred_knn = ____

Code bewerken en uitvoeren

Deze oefening maakt deel uit van de cursus

Ensemblemethoden in Python

SkillTag.level.advancedSkillTag.label

4.9+

Begin gratis met de cursus

Vind je het lastig om te bepalen welk van de modellen die je hebt gebouwd het beste is voor jouw probleem? Laat dat los en gebruik ze gewoon allemaal! In dit hoofdstuk leer je hoe je meerdere modellen kunt combineren tot één geheel met "Voting" en "Averaging". Je gebruikt deze om de beoordelingen van apps in de Google Play Store te voorspellen, of een Pokémon legendarisch is, en welke personages zullen sterven in Game of Thrones!

Exercise 1: Introductie tot ensemblemethoden Exercise 2: Google-appgegevens verkennen Exercise 3: De beoordeling van een app voorspellen Exercise 4: Voting Exercise 5: Het beste model kiezen

Huidige oefening

Exercise 6: Je eerste ensemble samenstellen Exercise 7: Je ensemble evalueren Exercise 8: Gemiddelden Exercise 9: Reis naar Westeros Exercise 10: Voorspellen wie er sterft in GoT Exercise 11: Soft vs. hard voting

Bagging is de ensemblemethode achter krachtige Machine Learning-algoritmen zoals random forests. In dit hoofdstuk leer je de theorie achter deze techniek en bouw je je eigen bagging-modellen met scikit-learn.

Exercise 1: De kracht van ‘zwakke’ modellen Exercise 2: Beperkte en onbeperkte beslisbomen Exercise 3: "Zwakke" beslisboom Exercise 4: Bootstrap-aggregatie Exercise 5: Trainen met bootstrapping Exercise 6: Een eerste poging tot bagging Exercise 7: BaggingClassifier: de fijne kneepjes Exercise 8: Bagging: de scikit-learn-manier Exercise 9: De out-of-bag-score controleren Exercise 10: Bagging-parameters: tips en tricks Exercise 11: De UCI SECOM-data verkennen Exercise 12: Een complexer bagging-model Exercise 13: Hyperparameters voor bagging afstemmen

Boosting is een klasse van ensemble learning-algoritmen waar prijswinnende modellen zoals AdaBoost onder vallen. In dit hoofdstuk leer je over dit bekroonde model en gebruik je het om de opbrengst van prijswinnende films te voorspellen! Je leert ook over gradient boosting-algoritmen zoals CatBoost en XGBoost.

Exercise 1: De effectiviteit van geleidelijk leren Exercise 2: Kennismaking met de filmdatabase Exercise 3: Filmeigenschappen verkennen Exercise 4: Filmomzet voorspellen Exercise 5: Boosting voor voorspelde omzet Exercise 6: Adaptive boosting: bekroond model Exercise 7: Je eerste AdaBoost-model Exercise 8: Boomgebaseerde AdaBoost-regressie Exercise 9: Haal alles uit AdaBoost Exercise 10: Gradient boosting Exercise 11: Google-apprecensies opnieuw bekijken Exercise 12: Sentimentanalyse met GBM Exercise 13: Verschillende smaken van gradient boosting Exercise 14: Filmomzet voorspellen met CatBoost Exercise 15: Boosting-wedstrijd: Light vs Extreme

Maak je klaar om te zien hoe alles zich opstapelt! In dit laatste hoofdstuk leer je over de stacking-ensemblemethode. Je leert hoe je deze implementeert met scikit-learn én met de mlxtend-bibliotheek! Je past stacking toe om de eetbaarheid van Noord-Amerikaanse paddenstoelen te voorspellen en kijkt opnieuw naar de beoordelingen van Google-apps met deze geavanceerdere aanpak.

Exercise 1: De intuïtie achter stacking Exercise 2: De mushroom-gegevensset verkennen Exercise 3: Eetbaarheid van paddenstoelen voorspellen Exercise 4: K-nearest neighbors voor paddenstoelen Exercise 5: Bouw je eerste stacked ensemble Exercise 6: Stacking toepassen om app-beoordelingen te voorspellen Exercise 7: De stacking-classifier bouwen Exercise 8: Gestapelde voorspellingen voor app-beoordelingen Exercise 9: Aan de slag met mlxtend!Exercise 10: Een eerste poging met mlxtend Exercise 11: Terug naar regressie met stacking Exercise 12: Paddenstoelen: een kwestie van leven of dood Exercise 13: Alles samenvoegen met ensembling