LDA आउटपुट की तुलना
हमने अभी तक केवल एक तय संख्या वाले टॉपिक्स के साथ LDA चलाया है। उस मॉडल का टाइड किया हुआ आउटपुट lda_out_tidy और dtm_twitter आपके वर्कस्पेस में लोड है। अब 3 टॉपिक्स के साथ LDA चलाइए और आउटपुट्स की तुलना कीजिए।
> lda_out_tidy
# A tibble: 35,928 x 3
topic term beta
<int> <chr> <dbl>
1 1 flight 0.0343
2 1 time 0.0102
3 2 service 0.00882
4 1 plane 0.00688
5 1 trip 0.00614
6 2 customer 0.00604
7 1 delayed 0.00596
8 2 airline 0.00593
9 1 hours 0.00532
10 1 day 0.00499
# ... with 35,918 more rows
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Text Analysis परिचय
अभ्यास निर्देश
- 3 टॉपिक्स और Gibbs सैंपलर के साथ LDA चलाइए (इसमें 10 या उससे अधिक सेकंड लग सकते हैं).
- शब्द संभावनाओं की मैट्रिक्स को टाइड कीजिए.
- शब्द संभावनाओं के आधार पर टॉपिक्स को घटते क्रम में व्यवस्थित कीजिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Run an LDA with 3 topics and a Gibbs sampler
lda_out2 <- ___(
___,
___,
___,
control = list(seed = 42)
)
# Tidy the matrix of word probabilities
lda_topics2 <- ___ %>%
___(___)
# Arrange the topics by word probabilities in descending order
___ %>%
___(___)