Kiểm tra perplexity
Bạn được cung cấp một tập dữ liệu gồm các tweet do các bot đăng trong kỳ bầu cử Mỹ năm 2016. Sếp của bạn đã xác định hai loại tài khoản quan tâm là Left và Right. Sếp yêu cầu bạn thực hiện topic modeling trên các tweet từ các bot thuộc nhóm Right. Ngoài ra, sếp cũng muốn tóm tắt nội dung các tweet này bằng topic modeling. Hãy chạy topic modeling với 5, 15 và 50 chủ đề để ước lượng nhìn chung dữ liệu này chứa khoảng bao nhiêu chủ đề.
Bài tập này là một phần của khóa học
Nhập môn Xử lý Ngôn ngữ Tự nhiên với R
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]
# Peform topic modeling
lda_model <- LDA(___, k = ___, method = ___,
control = list(seed = 1111))
# Train
___(lda_model, newdata = ___)
# Test
___(lda_model, newdata = ___)