Analiza sentimentelor cu GBM
Acum vom folosi GradientBoostingClassifier din scikit-learn pe setul de date reviews pentru a prezice sentimentul unui review pe baza textului său.
Nu vom transmite textul brut ca intrare pentru model. Următoarea preprocesare a fost realizată pentru tine:
- S-au eliminat recenziile cu valori lipsă.
- S-au selectat datele din cele mai populare 5 aplicații.
- S-a ales un sub-eșantion aleatoriu de 500 de recenzii.
- S-au eliminat „cuvintele de legătură" (stop words) din recenzii.
- Recenziile au fost transformate într-o matrice în care fiecare caracteristică reprezintă frecvența unui cuvânt într-o recenzie.
Vrei să înțelegi mai bine text mining-ul? Atunci consultă cursul Introduction to Natural Language Processing in Python!
Acest exercițiu face parte din cursul
Metode de ansamblu în Python
Instrucțiuni pentru exercițiu
- Construiește un
GradientBoostingClassifiercu100de estimatori și o rată de învățare de0.1. - Calculează predicțiile pe setul de testare.
- Calculează acuratețea pentru a evalua modelul.
- Calculează și afișează matricea de confuzie.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))
# Get and show the Confusion Matrix
cm = ____
print(cm)