Análisis de sentimientos con GBM
Ahora vamos a usar el GradientBoostingClassifier de scikit-learn sobre el conjunto de datos reviews para predecir el sentimiento de una reseña a partir de su texto.
No pasaremos el texto en bruto como entrada del modelo. Ya se han aplicado los siguientes pasos de preprocesamiento por ti:
- Eliminar reseñas con valores ausentes.
- Seleccionar datos de las 5 apps principales.
- Seleccionar una submuestra aleatoria de 500 reseñas.
- Eliminar las «stop words» de las reseñas.
- Transformar las reseñas en una matriz, en la que cada característica representa la frecuencia de una palabra en una reseña.
¿Quieres profundizar más en minería de texto? Entonces echa un vistazo al curso Introduction to Natural Language Processing in Python.
Este ejercicio forma parte del curso
Ensemble Methods in Python
Instrucciones del ejercicio
- Construye un
GradientBoostingClassifiercon100estimadores y una tasa de aprendizaje de0.1. - Calcula las predicciones sobre el conjunto de prueba.
- Calcula la exactitud para evaluar el modelo.
- Calcula e imprime la matriz de confusión.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))
# Get and show the Confusion Matrix
cm = ____
print(cm)