開始使用免費開始

測試困惑度(perplexity)

你拿到一個資料集,包含 2016 年美國大選期間由推特機器人發布的推文。你的主管鎖定兩種感興趣的帳號類型:LeftRight。你的主管要求你針對 Right 類型的推特機器人推文進行主題模型分析。此外,他也希望用主題模型來摘要這些推文的內容。請分別以 5、15、50 個主題進行主題模型,初步判斷資料大致包含多少個主題。

本練習屬於課程

R 的自然語言處理入門

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]

# Peform topic modeling 
lda_model <- LDA(___, k = ___, method = ___,
                 control = list(seed = 1111))
# Train
___(lda_model, newdata = ___) 
# Test
___(lda_model, newdata = ___) 
編輯並執行程式碼