Analiza sentymentu z GBM
Użyjmy teraz GradientBoostingClassifier z biblioteki scikit-learn na zbiorze danych reviews, aby przewidzieć sentyment recenzji na podstawie jej treści.
Nie będziemy przekazywać surowego tekstu bezpośrednio do modelu. Poniższe kroki przetwarzania wstępnego zostały już wykonane:
- Usunięcie recenzji z brakującymi wartościami.
- Wybranie danych z 5 najpopularniejszych aplikacji.
- Wylosowanie próbki 500 recenzji.
- Usunięcie „stop words" z recenzji.
- Przekształcenie recenzji w macierz, w której każda cecha reprezentuje częstotliwość występowania danego słowa w recenzji.
Chcesz lepiej zrozumieć przetwarzanie tekstu? Zajrzyj do kursu Introduction to Natural Language Processing in Python!
To ćwiczenie jest częścią kursu
Metody zespołowe w Pythonie
Instrukcje do ćwiczenia
- Zbuduj
GradientBoostingClassifierze100estymatorami i współczynnikiem uczenia0.1. - Oblicz predykcje na zbiorze testowym.
- Wyznacz dokładność, aby ocenić model.
- Oblicz i wyświetl macierz pomyłek.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))
# Get and show the Confusion Matrix
cm = ____
print(cm)