Аналіз тональності з GBM
Тепер використаємо GradientBoostingClassifier із scikit-learn (див. документацію) на наборі даних reviews, щоб передбачити тональність відгуку за його текстом.
Ми не передаватимемо в модель сирий текст. Попередньо для вас виконано таку обробку:
- Видалено відгуки з пропущеними значеннями.
- Відібрано дані з топ-5 застосунків.
- Вибрано випадкову підвибірку з 500 відгуків.
- Видалено «стоп-слова» з відгуків.
- Перетворено відгуки на матрицю, де кожна ознака відображає частоту слова у відгуку.
Хочете глибше зануритися в текстовий аналіз? Перегляньте курс Introduction to Natural Language Processing in Python!
Ця вправа є частиною курсу
Ансамблеві методи в Python
Інструкції до вправи
- Створіть
GradientBoostingClassifierзі100оцінювачами та швидкістю навчання0.1. - Обчисліть передбачення на тестовій вибірці.
- Розрахуйте точність для оцінювання моделі.
- Обчисліть і виведіть матрицю неточностей (confusion matrix).
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))
# Get and show the Confusion Matrix
cm = ____
print(cm)