Kom igångKom igång gratis

Sentimentanalys med GBM

Nu ska du använda scikit-learn's GradientBoostingClassifier på datamängden reviews för att förutsäga sentimentet i en recension utifrån dess text.

Vi skickar inte in den råa texten direkt till modellen. Följande förbehandling har redan gjorts åt dig:

  1. Ta bort recensioner med saknade värden.
  2. Välj data från de 5 mest populära apparna.
  3. Välj ett slumpmässigt urval på 500 recensioner.
  4. Ta bort "stoppord" från recensionerna.
  5. Omvandla recensionerna till en matris där varje särdrag representerar hur ofta ett ord förekommer i en recension.

Vill du fördjupa dig i textanalys? Ta en titt på kursen Introduction to Natural Language Processing in Python!

Den här övningen är en del av kursen

Ensemblemetoder i Python

Visa kurs

Övningsinstruktioner

  • Bygg en GradientBoostingClassifier med 100 estimatorer och en inlärningshastighet på 0.1.
  • Beräkna prediktionerna på testmängden.
  • Beräkna noggrannheten för att utvärdera modellen.
  • Beräkna och skriv ut konfusionsmatrisen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)
Redigera och kör kod