Zacznij terazZacznij za darmo

Analiza sentymentu z GBM

Użyjmy teraz GradientBoostingClassifier z biblioteki scikit-learn na zbiorze danych reviews, aby przewidzieć sentyment recenzji na podstawie jej treści.

Nie będziemy przekazywać surowego tekstu bezpośrednio do modelu. Poniższe kroki przetwarzania wstępnego zostały już wykonane:

  1. Usunięcie recenzji z brakującymi wartościami.
  2. Wybranie danych z 5 najpopularniejszych aplikacji.
  3. Wylosowanie próbki 500 recenzji.
  4. Usunięcie „stop words" z recenzji.
  5. Przekształcenie recenzji w macierz, w której każda cecha reprezentuje częstotliwość występowania danego słowa w recenzji.

Chcesz lepiej zrozumieć przetwarzanie tekstu? Zajrzyj do kursu Introduction to Natural Language Processing in Python!

To ćwiczenie jest częścią kursu

Metody zespołowe w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zbuduj GradientBoostingClassifier ze 100 estymatorami i współczynnikiem uczenia 0.1.
  • Oblicz predykcje na zbiorze testowym.
  • Wyznacz dokładność, aby ocenić model.
  • Oblicz i wyświetl macierz pomyłek.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)
Edytuj i uruchom kod