ÎncepețiÎncepe gratuit

Analiza sentimentelor cu GBM

Acum vom folosi GradientBoostingClassifier din scikit-learn pe setul de date reviews pentru a prezice sentimentul unui review pe baza textului său.

Nu vom transmite textul brut ca intrare pentru model. Următoarea preprocesare a fost realizată pentru tine:

  1. S-au eliminat recenziile cu valori lipsă.
  2. S-au selectat datele din cele mai populare 5 aplicații.
  3. S-a ales un sub-eșantion aleatoriu de 500 de recenzii.
  4. S-au eliminat „cuvintele de legătură" (stop words) din recenzii.
  5. Recenziile au fost transformate într-o matrice în care fiecare caracteristică reprezintă frecvența unui cuvânt într-o recenzie.

Vrei să înțelegi mai bine text mining-ul? Atunci consultă cursul Introduction to Natural Language Processing in Python!

Acest exercițiu face parte din cursul

Metode de ansamblu în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Construiește un GradientBoostingClassifier cu 100 de estimatori și o rată de învățare de 0.1.
  • Calculează predicțiile pe setul de testare.
  • Calculează acuratețea pentru a evalua modelul.
  • Calculează și afișează matricea de confuzie.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)
Editează și rulează codul