เปรียบเทียบผลลัพธ์ของ LDA
เราได้รัน LDA มาแล้วครั้งหนึ่งโดยกำหนดจำนวนหัวข้อที่แน่นอน ผลลัพธ์ที่จัดระเบียบแล้วจากโมเดลนั้น ซึ่งก็คือ lda_out_tidy ถูกโหลดไว้พร้อมกับ dtm_twitter ใน workspace ของคุณแล้ว ลองรัน LDA ด้วย 3 หัวข้อ แล้วเปรียบเทียบผลลัพธ์ที่ได้
> lda_out_tidy
# A tibble: 35,928 x 3
topic term beta
<int> <chr> <dbl>
1 1 flight 0.0343
2 1 time 0.0102
3 2 service 0.00882
4 1 plane 0.00688
5 1 trip 0.00614
6 2 customer 0.00604
7 1 delayed 0.00596
8 2 airline 0.00593
9 1 hours 0.00532
10 1 day 0.00499
# ... with 35,918 more rows
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์ข้อความเบื้องต้นใน R
คำแนะนำการฝึกหัด
- รัน LDA ด้วย 3 หัวข้อ โดยใช้ Gibbs sampler (อาจใช้เวลา 10 วินาทีขึ้นไป)
- จัดระเบียบเมทริกซ์ค่าความน่าจะเป็นของคำด้วย tidy
- เรียงหัวข้อตามค่าความน่าจะเป็นของคำจากมากไปน้อย
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Run an LDA with 3 topics and a Gibbs sampler
lda_out2 <- ___(
___,
___,
___,
control = list(seed = 42)
)
# Tidy the matrix of word probabilities
lda_topics2 <- ___ %>%
___(___)
# Arrange the topics by word probabilities in descending order
___ %>%
___(___)