Začněte nyníZačněte zdarma

Analýza sentimentu s GBM

Teď použijeme GradientBoostingClassifier z scikit-learn na datasetu reviews, abychom na základě textu recenze předpověděli její sentiment.

Jako vstup modelu nebudeme předávat surový text. Následující předzpracování dat už bylo provedeno za tebe:

  1. Odebrání recenzí s chybějícími hodnotami.
  2. Výběr dat z 5 nejpopulárnějších aplikací.
  3. Náhodný výběr 500 recenzí.
  4. Odstranění „stop slov" z recenzí.
  5. Převod recenzí na matici, kde každý příznak reprezentuje četnost daného slova v recenzi.

Chceš lépe porozumět dolování textu? Podívej se na kurz Introduction to Natural Language Processing in Python!

Toto cvičení je součástí kurzu

Ensemble Methods in Python

Zobrazit kurz

Pokyny k cvičení

  • Sestav GradientBoostingClassifier se 100 estimátory a hodnotou learning rate 0.1.
  • Vypočítej predikce na testovací sadě.
  • Vyhodnoť model výpočtem přesnosti.
  • Vypočítej a vypiš matici záměn.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)
Upravit a spustit kód