Анализ тональности с помощью GBM
Теперь применим GradientBoostingClassifier из scikit-learn к набору данных reviews, чтобы предсказать тональность отзыва по его тексту.
Мы не будем передавать сырой текст напрямую в модель. Следующая предобработка уже выполнена за вас:
- Удалены отзывы с пропущенными значениями.
- Отобраны данные по 5 наиболее популярным приложениям.
- Выбрана случайная подвыборка из 500 отзывов.
- Из отзывов удалены «стоп-слова».
- Отзывы преобразованы в матрицу, в которой каждый признак отражает частоту слова в отзыве.
Хотите глубже разобраться в анализе текстов? Пройдите курс Introduction to Natural Language Processing in Python!
Это упражнение является частью курса
Ансамблевые методы в Python
Инструкции к упражнению
- Создайте
GradientBoostingClassifierсо100деревьями и скоростью обучения0.1. - Вычислите предсказания на тестовой выборке.
- Рассчитайте точность для оценки модели.
- Вычислите и выведите матрицу ошибок.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))
# Get and show the Confusion Matrix
cm = ____
print(cm)