N-грамами вищого порядку для аналізу тональності
Подібно до попередньої вправи, ми збудуємо класифікатор, який визначає, чи є відгук про певний фільм позитивним або негативним. Проте цього разу ми використаємо n-грами до n=2 для цього завдання.
Тренувальні відгуки у форматі n-грам доступні як X_train_ng. Відповідні тестові відгуки доступні як X_test_ng. Нарешті, використайте y_train та y_test, щоб отримати відповідно класи тональності для тренування та тестування.
Ця вправа є частиною курсу
Інженерія ознак для NLP у Python
Інструкції до вправи
- Створіть екземпляр MultinomialNB і назвіть його
clf_ng. - Навчіть класифікатор на
X_train_ngіy_train. - Виміряйте
accuracyнаX_test_ngіy_testза допомогою методуscore().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Define an instance of MultinomialNB
clf_ng = ____
# Fit the classifier
clf_ng.____(____, ____)
# Measure the accuracy
accuracy = ____
print("The accuracy of the classifier on the test set is %.3f" % accuracy)
# Predict the sentiment of a negative review
review = "The movie was not good. The plot had several holes and the acting lacked panache."
prediction = clf_ng.predict(ng_vectorizer.transform([review]))[0]
print("The sentiment predicted by the classifier is %i" % (prediction))