НачатьНачать бесплатно

Анализ тональности с помощью GBM

Теперь применим GradientBoostingClassifier из scikit-learn к набору данных reviews, чтобы предсказать тональность отзыва по его тексту.

Мы не будем передавать сырой текст напрямую в модель. Следующая предобработка уже выполнена за вас:

  1. Удалены отзывы с пропущенными значениями.
  2. Отобраны данные по 5 наиболее популярным приложениям.
  3. Выбрана случайная подвыборка из 500 отзывов.
  4. Из отзывов удалены «стоп-слова».
  5. Отзывы преобразованы в матрицу, в которой каждый признак отражает частоту слова в отзыве.

Хотите глубже разобраться в анализе текстов? Пройдите курс Introduction to Natural Language Processing in Python!

Это упражнение является частью курса

Ансамблевые методы в Python

Посмотреть курс

Инструкции к упражнению

  • Создайте GradientBoostingClassifier со 100 деревьями и скоростью обучения 0.1.
  • Вычислите предсказания на тестовой выборке.
  • Рассчитайте точность для оценки модели.
  • Вычислите и выведите матрицу ошибок.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)
Редактировать и запускать код