Przewidywanie wydźwięku recenzji filmowej
W poprzednim ćwiczeniu wygenerowano reprezentacje bag-of-words dla danych treningowych i testowych z recenzjami filmów. W tym ćwiczeniu wykorzystamy ten model do wytrenowania klasyfikatora Naive Bayes, który potrafi wykrywać wydźwięk recenzji filmowej i obliczać jej dokładność. Zwróć uwagę, że jest to problem klasyfikacji binarnej – model potrafi zaklasyfikować recenzję wyłącznie jako pozytywną (1) lub negatywną (0). Nie jest w stanie wykrywać recenzji neutralnych.
Dla przypomnienia: wektory BoW dla zbioru treningowego i testowego są dostępne odpowiednio jako X_train_bow i X_test_bow. Odpowiadające im etykiety są dostępne jako y_train i y_test. Oryginalny zbiór danych z recenzjami filmów jest dostępny jako df.
To ćwiczenie jest częścią kursu
Inżynieria cech dla NLP w Pythonie
Instrukcje do ćwiczenia
- Utwórz obiekt klasy
MultinomialNBi nadaj mu nazwęclf. - Dopasuj
clf, używającX_train_bowiy_train. - Zmierz dokładność
clf, używającX_test_bowiy_test.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a MultinomialNB object
clf = ____
# Fit the classifier
clf.____(____, ____)
# Measure the accuracy
accuracy = clf.score(____, ____)
print("The accuracy of the classifier on the test set is %.3f" % accuracy)
# Predict the sentiment of a negative review
review = "The movie was terrible. The music was underwhelming and the acting mediocre."
prediction = clf.predict(vectorizer.transform([review]))[0]
print("The sentiment predicted by the classifier is %i" % (prediction))