Stacking toepassen om app-beoordelingen te voorspellen

In deze oefening ga je je eerste Stacking-ensemble bouwen. De gegevensset die je gebruikt is dezelfde als in Hoofdstuk 1. Zoals je je misschien herinnert, is het doel om de beoordeling van elke app te voorspellen (van 1 tot 5). De invoerkenmerken die we gebruiken zijn: Reviews, Size, Installs, Type, Price en Content Rating.

We hebben stap 1: de gegevensset voorbereiden al gedaan. Deze is beschikbaar als apps. We hebben de vereiste kenmerken opgeschoond en ontbrekende waarden vervangen door nullen.

Nu ga je aan de slag met stap 2: de schatters van de eerste laag bouwen.

Deze oefening maakt deel uit van de cursus

Ensemblemethoden in Python

Oefeninstructies

Bouw en fit een beslissingsboomclassifier met: min_samples_leaf: 3 en min_samples_split: 9.
Bouw en fit een 5-nearest neighbors-classifier met: algorithm: 'ball_tree' (om de verwerking te versnellen).
Evalueer de prestaties van elke schatter met de accuracy-score op de testset.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Build and fit a Decision Tree classifier
clf_dt = ____(____, ____, random_state=500)
clf_dt.____

# Build and fit a 5-nearest neighbors classifier using the 'Ball-Tree' algorithm
clf_knn = ____
clf_knn.____

# Evaluate the performance using the accuracy score
print('Decision Tree: {:0.4f}'.format(accuracy_score(____)))
print('5-Nearest Neighbors: {:0.4f}'.format(accuracy_score(____)))

Code bewerken en uitvoeren

Deze oefening maakt deel uit van de cursus

Ensemblemethoden in Python

SkillTag.level.advancedSkillTag.label

4.9+

Begin gratis met de cursus

Vind je het lastig om te bepalen welk van de modellen die je hebt gebouwd het beste is voor jouw probleem? Laat dat los en gebruik ze gewoon allemaal! In dit hoofdstuk leer je hoe je meerdere modellen kunt combineren tot één geheel met "Voting" en "Averaging". Je gebruikt deze om de beoordelingen van apps in de Google Play Store te voorspellen, of een Pokémon legendarisch is, en welke personages zullen sterven in Game of Thrones!

Exercise 1: Introductie tot ensemblemethoden Exercise 2: Google-appgegevens verkennen Exercise 3: De beoordeling van een app voorspellen Exercise 4: Voting Exercise 5: Het beste model kiezen Exercise 6: Je eerste ensemble samenstellen Exercise 7: Je ensemble evalueren Exercise 8: Gemiddelden Exercise 9: Reis naar Westeros Exercise 10: Voorspellen wie er sterft in GoT Exercise 11: Soft vs. hard voting

Bagging is de ensemblemethode achter krachtige Machine Learning-algoritmen zoals random forests. In dit hoofdstuk leer je de theorie achter deze techniek en bouw je je eigen bagging-modellen met scikit-learn.

Exercise 1: De kracht van ‘zwakke’ modellen Exercise 2: Beperkte en onbeperkte beslisbomen Exercise 3: "Zwakke" beslisboom Exercise 4: Bootstrap-aggregatie Exercise 5: Trainen met bootstrapping Exercise 6: Een eerste poging tot bagging Exercise 7: BaggingClassifier: de fijne kneepjes Exercise 8: Bagging: de scikit-learn-manier Exercise 9: De out-of-bag-score controleren Exercise 10: Bagging-parameters: tips en tricks Exercise 11: De UCI SECOM-data verkennen Exercise 12: Een complexer bagging-model Exercise 13: Hyperparameters voor bagging afstemmen

Boosting is een klasse van ensemble learning-algoritmen waar prijswinnende modellen zoals AdaBoost onder vallen. In dit hoofdstuk leer je over dit bekroonde model en gebruik je het om de opbrengst van prijswinnende films te voorspellen! Je leert ook over gradient boosting-algoritmen zoals CatBoost en XGBoost.

Exercise 1: De effectiviteit van geleidelijk leren Exercise 2: Kennismaking met de filmdatabase Exercise 3: Filmeigenschappen verkennen Exercise 4: Filmomzet voorspellen Exercise 5: Boosting voor voorspelde omzet Exercise 6: Adaptive boosting: bekroond model Exercise 7: Je eerste AdaBoost-model Exercise 8: Boomgebaseerde AdaBoost-regressie Exercise 9: Haal alles uit AdaBoost Exercise 10: Gradient boosting Exercise 11: Google-apprecensies opnieuw bekijken Exercise 12: Sentimentanalyse met GBM Exercise 13: Verschillende smaken van gradient boosting Exercise 14: Filmomzet voorspellen met CatBoost Exercise 15: Boosting-wedstrijd: Light vs Extreme

Maak je klaar om te zien hoe alles zich opstapelt! In dit laatste hoofdstuk leer je over de stacking-ensemblemethode. Je leert hoe je deze implementeert met scikit-learn én met de mlxtend-bibliotheek! Je past stacking toe om de eetbaarheid van Noord-Amerikaanse paddenstoelen te voorspellen en kijkt opnieuw naar de beoordelingen van Google-apps met deze geavanceerdere aanpak.

Exercise 1: De intuïtie achter stacking Exercise 2: De mushroom-gegevensset verkennen Exercise 3: Eetbaarheid van paddenstoelen voorspellen Exercise 4: K-nearest neighbors voor paddenstoelen Exercise 5: Bouw je eerste stacked ensemble Exercise 6: Stacking toepassen om app-beoordelingen te voorspellen

Huidige oefening

Exercise 7: De stacking-classifier bouwen Exercise 8: Gestapelde voorspellingen voor app-beoordelingen Exercise 9: Aan de slag met mlxtend!Exercise 10: Een eerste poging met mlxtend Exercise 11: Terug naar regressie met stacking Exercise 12: Paddenstoelen: een kwestie van leven of dood Exercise 13: Alles samenvoegen met ensembling