Bắt đầu ngayBắt đầu miễn phí

So sánh hiệu năng của các mô hình n-gram

Giờ bạn đã biết cách phân tích cảm xúc bằng cách chuyển văn bản thành nhiều biểu diễn n-gram khác nhau và đưa chúng vào một bộ phân loại. Trong bài tập này, chúng ta sẽ phân tích cảm xúc cho cùng tập đánh giá phim như trước bằng hai mô hình n-gram: unigram và n-gram với n tối đa bằng 3.

Sau đó, chúng ta sẽ so sánh hiệu năng theo ba tiêu chí: độ chính xác của mô hình trên tập kiểm tra, thời gian chạy chương trình và số lượng đặc trưng được tạo ra khi sinh biểu diễn n-gram.

Bài tập này là một phần của khóa học

Khai thác đặc trưng cho NLP bằng Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

start_time = time.time()
# Splitting the data into training and test sets
train_X, test_X, train_y, test_y = train_test_split(df['review'], df['sentiment'], test_size=0.5, random_state=42, stratify=df['sentiment'])

# Generating ngrams
vectorizer = ___
train_X = vectorizer.fit_transform(train_X)
test_X = vectorizer.transform(test_X)

# Fit classifier
clf = MultinomialNB()
clf.fit(train_X, train_y)

# Print accuracy, time and number of dimensions
print("The program took %.3f seconds to complete. The accuracy on the test set is %.2f. The ngram representation had %i features." % (time.time() - start_time, clf.score(test_X, test_y), train_X.shape[1]))
Chỉnh sửa và Chạy Mã