Začněte nyníZačněte zdarma

Testování perplexity

Máš k dispozici datovou sadu plnou tweetů, které v průběhu amerických voleb v roce 2016 rozesílali tweetboti. Tvůj šéf identifikoval dva typy účtů, které ho zajímají: Left a Right. Požádal tě, abys provedl/a topic modeling na tweetech od botů typu Right. Cílem je shrnout obsah těchto tweetů pomocí topic modelingu. Vyzkoušej modelování s 5, 15 a 50 tématy a zjisti, kolik témat data přibližně obsahují.

Toto cvičení je součástí kurzu

Úvod do zpracování přirozeného jazyka v R

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]

# Peform topic modeling 
lda_model <- LDA(___, k = ___, method = ___,
                 control = list(seed = 1111))
# Train
___(lda_model, newdata = ___) 
# Test
___(lda_model, newdata = ___) 
Upravit a spustit kód