Sentimentanalyse met GBM

Laten we nu scikit-learn's GradientBoostingClassifier gebruiken op de reviews-gegevensset om het sentiment van een review te voorspellen op basis van de tekst.

We voeren de ruwe tekst niet direct aan het model. De volgende preprocessing is alvast voor je gedaan:

Reviews met ontbrekende waarden verwijderen.
Gegevens van de top 5 apps selecteren.
Een willekeurige subsample van 500 reviews selecteren.
"Stopwoorden" uit de reviews verwijderen.
De reviews omzetten naar een matrix, waarin elk kenmerk de frequentie van een woord in een review weergeeft.

Wil je dieper in text mining duiken? Bekijk dan de cursus Introduction to Natural Language Processing in Python!

Deze oefening maakt deel uit van de cursus

Ensemblemethoden in Python

Oefeninstructies

Bouw een GradientBoostingClassifier met 100 estimators en een learning rate van 0.1.
Bereken de voorspellingen op de testset.
Bereken de accuracy om het model te evalueren.
Bereken en print de confusion matrix.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)

Code bewerken en uitvoeren

Deze oefening maakt deel uit van de cursus

Ensemblemethoden in Python

SkillTag.level.advancedSkillTag.label

4.9+

Begin gratis met de cursus

Vind je het lastig om te bepalen welk van de modellen die je hebt gebouwd het beste is voor jouw probleem? Laat dat los en gebruik ze gewoon allemaal! In dit hoofdstuk leer je hoe je meerdere modellen kunt combineren tot één geheel met "Voting" en "Averaging". Je gebruikt deze om de beoordelingen van apps in de Google Play Store te voorspellen, of een Pokémon legendarisch is, en welke personages zullen sterven in Game of Thrones!

Exercise 1: Introductie tot ensemblemethoden Exercise 2: Google-appgegevens verkennen Exercise 3: De beoordeling van een app voorspellen Exercise 4: Voting Exercise 5: Het beste model kiezen Exercise 6: Je eerste ensemble samenstellen Exercise 7: Je ensemble evalueren Exercise 8: Gemiddelden Exercise 9: Reis naar Westeros Exercise 10: Voorspellen wie er sterft in GoT Exercise 11: Soft vs. hard voting

Bagging is de ensemblemethode achter krachtige Machine Learning-algoritmen zoals random forests. In dit hoofdstuk leer je de theorie achter deze techniek en bouw je je eigen bagging-modellen met scikit-learn.

Exercise 1: De kracht van ‘zwakke’ modellen Exercise 2: Beperkte en onbeperkte beslisbomen Exercise 3: "Zwakke" beslisboom Exercise 4: Bootstrap-aggregatie Exercise 5: Trainen met bootstrapping Exercise 6: Een eerste poging tot bagging Exercise 7: BaggingClassifier: de fijne kneepjes Exercise 8: Bagging: de scikit-learn-manier Exercise 9: De out-of-bag-score controleren Exercise 10: Bagging-parameters: tips en tricks Exercise 11: De UCI SECOM-data verkennen Exercise 12: Een complexer bagging-model Exercise 13: Hyperparameters voor bagging afstemmen

Boosting is een klasse van ensemble learning-algoritmen waar prijswinnende modellen zoals AdaBoost onder vallen. In dit hoofdstuk leer je over dit bekroonde model en gebruik je het om de opbrengst van prijswinnende films te voorspellen! Je leert ook over gradient boosting-algoritmen zoals CatBoost en XGBoost.

Exercise 1: De effectiviteit van geleidelijk leren Exercise 2: Kennismaking met de filmdatabase Exercise 3: Filmeigenschappen verkennen Exercise 4: Filmomzet voorspellen Exercise 5: Boosting voor voorspelde omzet Exercise 6: Adaptive boosting: bekroond model Exercise 7: Je eerste AdaBoost-model Exercise 8: Boomgebaseerde AdaBoost-regressie Exercise 9: Haal alles uit AdaBoost Exercise 10: Gradient boosting Exercise 11: Google-apprecensies opnieuw bekijken Exercise 12: Sentimentanalyse met GBM

Huidige oefening

Exercise 13: Verschillende smaken van gradient boosting Exercise 14: Filmomzet voorspellen met CatBoost Exercise 15: Boosting-wedstrijd: Light vs Extreme

Maak je klaar om te zien hoe alles zich opstapelt! In dit laatste hoofdstuk leer je over de stacking-ensemblemethode. Je leert hoe je deze implementeert met scikit-learn én met de mlxtend-bibliotheek! Je past stacking toe om de eetbaarheid van Noord-Amerikaanse paddenstoelen te voorspellen en kijkt opnieuw naar de beoordelingen van Google-apps met deze geavanceerdere aanpak.

Exercise 1: De intuïtie achter stacking Exercise 2: De mushroom-gegevensset verkennen Exercise 3: Eetbaarheid van paddenstoelen voorspellen Exercise 4: K-nearest neighbors voor paddenstoelen Exercise 5: Bouw je eerste stacked ensemble Exercise 6: Stacking toepassen om app-beoordelingen te voorspellen Exercise 7: De stacking-classifier bouwen Exercise 8: Gestapelde voorspellingen voor app-beoordelingen Exercise 9: Aan de slag met mlxtend!Exercise 10: Een eerste poging met mlxtend Exercise 11: Terug naar regressie met stacking Exercise 12: Paddenstoelen: een kwestie van leven of dood Exercise 13: Alles samenvoegen met ensembling