Analýza sentimentu s GBM
Teď použijeme GradientBoostingClassifier z scikit-learn na datasetu reviews, abychom na základě textu recenze předpověděli její sentiment.
Jako vstup modelu nebudeme předávat surový text. Následující předzpracování dat už bylo provedeno za tebe:
- Odebrání recenzí s chybějícími hodnotami.
- Výběr dat z 5 nejpopulárnějších aplikací.
- Náhodný výběr 500 recenzí.
- Odstranění „stop slov" z recenzí.
- Převod recenzí na matici, kde každý příznak reprezentuje četnost daného slova v recenzi.
Chceš lépe porozumět dolování textu? Podívej se na kurz Introduction to Natural Language Processing in Python!
Toto cvičení je součástí kurzu
Ensemble Methods in Python
Pokyny k cvičení
- Sestav
GradientBoostingClassifierse100estimátory a hodnotou learning rate0.1. - Vypočítej predikce na testovací sadě.
- Vyhodnoť model výpočtem přesnosti.
- Vypočítej a vypiš matici záměn.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))
# Get and show the Confusion Matrix
cm = ____
print(cm)