Bắt đầu ngayBắt đầu miễn phí

Kiểm tra perplexity

Bạn được cung cấp một tập dữ liệu gồm các tweet do các bot đăng trong kỳ bầu cử Mỹ năm 2016. Sếp của bạn đã xác định hai loại tài khoản quan tâm là LeftRight. Sếp yêu cầu bạn thực hiện topic modeling trên các tweet từ các bot thuộc nhóm Right. Ngoài ra, sếp cũng muốn tóm tắt nội dung các tweet này bằng topic modeling. Hãy chạy topic modeling với 5, 15 và 50 chủ đề để ước lượng nhìn chung dữ liệu này chứa khoảng bao nhiêu chủ đề.

Bài tập này là một phần của khóa học

Nhập môn Xử lý Ngôn ngữ Tự nhiên với R

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]

# Peform topic modeling 
lda_model <- LDA(___, k = ___, method = ___,
                 control = list(seed = 1111))
# Train
___(lda_model, newdata = ___) 
# Test
___(lda_model, newdata = ___) 
Chỉnh sửa và Chạy Mã