ПочатиПочніть безкоштовно

Аналіз тональності з GBM

Тепер використаємо GradientBoostingClassifier із scikit-learn (див. документацію) на наборі даних reviews, щоб передбачити тональність відгуку за його текстом.

Ми не передаватимемо в модель сирий текст. Попередньо для вас виконано таку обробку:

  1. Видалено відгуки з пропущеними значеннями.
  2. Відібрано дані з топ-5 застосунків.
  3. Вибрано випадкову підвибірку з 500 відгуків.
  4. Видалено «стоп-слова» з відгуків.
  5. Перетворено відгуки на матрицю, де кожна ознака відображає частоту слова у відгуку.

Хочете глибше зануритися в текстовий аналіз? Перегляньте курс Introduction to Natural Language Processing in Python!

Ця вправа є частиною курсу

Ансамблеві методи в Python

Переглянути курс

Інструкції до вправи

  • Створіть GradientBoostingClassifier зі 100 оцінювачами та швидкістю навчання 0.1.
  • Обчисліть передбачення на тестовій вибірці.
  • Розрахуйте точність для оцінювання моделі.
  • Обчисліть і виведіть матрицю неточностей (confusion matrix).

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)
Редагувати та запускати код