НачатьНачать бесплатно

Сравнение производительности моделей n-грамм

Теперь вы знаете, как проводить анализ тональности, преобразуя текст в различные представления n-грамм и передавая их в классификатор. В этом упражнении мы проведём анализ тональности тех же рецензий на фильмы, используя две модели n-грамм: унаграммы и n-граммы с n не более 3.

Затем мы сравним производительность по трём критериям: точность модели на тестовой выборке, время выполнения программы и количество признаков, созданных при формировании представления n-грамм.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

start_time = time.time()
# Splitting the data into training and test sets
train_X, test_X, train_y, test_y = train_test_split(df['review'], df['sentiment'], test_size=0.5, random_state=42, stratify=df['sentiment'])

# Generating ngrams
vectorizer = ___
train_X = vectorizer.fit_transform(train_X)
test_X = vectorizer.transform(test_X)

# Fit classifier
clf = MultinomialNB()
clf.fit(train_X, train_y)

# Print accuracy, time and number of dimensions
print("The program took %.3f seconds to complete. The accuracy on the test set is %.2f. The ngram representation had %i features." % (time.time() - start_time, clf.score(test_X, test_y), train_X.shape[1]))
Редактировать и запускать код