ÎncepețiÎncepe gratuit

Testarea perplexității

Ai primit un set de date cu tweet-uri trimise de boți în timpul alegerilor prezidențiale din SUA din 2016. Șeful tău a identificat două tipuri de conturi de interes: Left și Right. Ți s-a cerut să aplici modelarea tematică pe tweet-urile boților de tip Right. Mai mult, șeful tău speră să rezume conținutul acestor tweet-uri folosind modelarea tematică. Aplică modelarea tematică pentru 5, 15 și 50 de teme, pentru a determina câte teme sunt conținute în date.

Acest exercițiu face parte din cursul

Introducere în Prelucrarea Limbajului Natural în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]

# Peform topic modeling 
lda_model <- LDA(___, k = ___, method = ___,
                 control = list(seed = 1111))
# Train
___(lda_model, newdata = ___) 
# Test
___(lda_model, newdata = ___) 
Editează și rulează codul