Zacznij terazZacznij za darmo

Krok 3: Budowanie klasyfikatora

To ostatni krok w przewidywaniu sentymentu. Dane zostały wcześniej zbadane i wzbogacone o cechy związane z sentymentem, a następnie przekształcone w wektory liczbowe.

Skorzystasz ze zbioru danych przygotowanego w poprzednich krokach. Zawiera on cechę opisującą długość recenzji oraz 200 cech wygenerowanych przez wektoryzator Tfidf.

Twoim zadaniem jest wytrenowanie regresji logistycznej do przewidywania sentymentu. Dane zostały już zaimportowane i zapisane jako reviews_transformed. Zmienna docelowa nosi nazwę score i ma wartości binarne: 1 dla pozytywnych recenzji produktu i 0 w pozostałych przypadkach.

Wytrenuj model regresji logistycznej i oceń jego działanie na danych testowych. Jak dobrze sobie radzi?

Wszystkie wymagane biblioteki zostały już zaimportowane.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Przeprowadź podział na zbiór treningowy i testowy, przeznaczając 20% danych do testowania i ustawiając ziarno losowości na 456.
  • Wytrenuj model regresji logistycznej.
  • Przewidź klasę.
  • Wyświetl wynik dokładności oraz macierz pomyłek na zbiorze testowym.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)

# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)

# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)

# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))
Edytuj i uruchom kod