Zacznij terazZacznij za darmo

Testowanie perplexity

Otrzymujesz zbiór danych zawierający tweety wysłane przez boty tweetowe podczas wyborów prezydenckich w USA w 2016 roku. Twój przełożony zidentyfikował dwa typy kont, które go interesują: Left i Right. Poproszono cię o przeprowadzenie modelowania tematów na tweetach botów typu Right. Celem jest podsumowanie zawartości tych tweetów za pomocą modelowania tematów. Wykonaj modelowanie tematów dla 5, 15 i 50 tematów, aby określić przybliżoną liczbę tematów zawartych w danych.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]

# Peform topic modeling 
lda_model <- LDA(___, k = ___, method = ___,
                 control = list(seed = 1111))
# Train
___(lda_model, newdata = ___) 
# Test
___(lda_model, newdata = ___) 
Edytuj i uruchom kod