Sentimentanalys med GBM
Nu ska du använda scikit-learn's GradientBoostingClassifier på datamängden reviews för att förutsäga sentimentet i en recension utifrån dess text.
Vi skickar inte in den råa texten direkt till modellen. Följande förbehandling har redan gjorts åt dig:
- Ta bort recensioner med saknade värden.
- Välj data från de 5 mest populära apparna.
- Välj ett slumpmässigt urval på 500 recensioner.
- Ta bort "stoppord" från recensionerna.
- Omvandla recensionerna till en matris där varje särdrag representerar hur ofta ett ord förekommer i en recension.
Vill du fördjupa dig i textanalys? Ta en titt på kursen Introduction to Natural Language Processing in Python!
Den här övningen är en del av kursen
Ensemblemetoder i Python
Övningsinstruktioner
- Bygg en
GradientBoostingClassifiermed100estimatorer och en inlärningshastighet på0.1. - Beräkna prediktionerna på testmängden.
- Beräkna noggrannheten för att utvärdera modellen.
- Beräkna och skriv ut konfusionsmatrisen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))
# Get and show the Confusion Matrix
cm = ____
print(cm)