เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

เปรียบเทียบผลลัพธ์ของ LDA

เราได้รัน LDA มาแล้วครั้งหนึ่งโดยกำหนดจำนวนหัวข้อที่แน่นอน ผลลัพธ์ที่จัดระเบียบแล้วจากโมเดลนั้น ซึ่งก็คือ lda_out_tidy ถูกโหลดไว้พร้อมกับ dtm_twitter ใน workspace ของคุณแล้ว ลองรัน LDA ด้วย 3 หัวข้อ แล้วเปรียบเทียบผลลัพธ์ที่ได้

> lda_out_tidy

# A tibble: 35,928 x 3
   topic term        beta
   <int> <chr>      <dbl>
 1     1 flight   0.0343 
 2     1 time     0.0102 
 3     2 service  0.00882
 4     1 plane    0.00688
 5     1 trip     0.00614
 6     2 customer 0.00604
 7     1 delayed  0.00596
 8     2 airline  0.00593
 9     1 hours    0.00532
10     1 day      0.00499
# ... with 35,918 more rows

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การวิเคราะห์ข้อความเบื้องต้นใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

  • รัน LDA ด้วย 3 หัวข้อ โดยใช้ Gibbs sampler (อาจใช้เวลา 10 วินาทีขึ้นไป)
  • จัดระเบียบเมทริกซ์ค่าความน่าจะเป็นของคำด้วย tidy
  • เรียงหัวข้อตามค่าความน่าจะเป็นของคำจากมากไปน้อย

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Run an LDA with 3 topics and a Gibbs sampler
lda_out2 <- ___(
  ___,
  ___,
  ___,
  control = list(seed = 42)
)

# Tidy the matrix of word probabilities
lda_topics2 <- ___ %>% 
  ___(___)

# Arrange the topics by word probabilities in descending order
___ %>% 
  ___(___)
แก้ไขและรันโค้ด