EmpezarEmpieza gratis

Análisis de sentimientos con GBM

Ahora vamos a usar el GradientBoostingClassifier de scikit-learn sobre el conjunto de datos reviews para predecir el sentimiento de una reseña a partir de su texto.

No pasaremos el texto en bruto como entrada del modelo. Ya se han aplicado los siguientes pasos de preprocesamiento por ti:

  1. Eliminar reseñas con valores ausentes.
  2. Seleccionar datos de las 5 apps principales.
  3. Seleccionar una submuestra aleatoria de 500 reseñas.
  4. Eliminar las «stop words» de las reseñas.
  5. Transformar las reseñas en una matriz, en la que cada característica representa la frecuencia de una palabra en una reseña.

¿Quieres profundizar más en minería de texto? Entonces echa un vistazo al curso Introduction to Natural Language Processing in Python.

Este ejercicio forma parte del curso

Ensemble Methods in Python

Ver curso

Instrucciones del ejercicio

  • Construye un GradientBoostingClassifier con 100 estimadores y una tasa de aprendizaje de 0.1.
  • Calcula las predicciones sobre el conjunto de prueba.
  • Calcula la exactitud para evaluar el modelo.
  • Calcula e imprime la matriz de confusión.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)
Editar y ejecutar código