Kom igångKom igång gratis

Testa perplexitet

Du har fått en datamängd med tweets som skickades av twitterbotar under det amerikanska valet 2016. Din chef har identifierat två kontotyper av intresse: Left och Right. Du har blivit ombedd att utföra ämnesmodellering på tweets från Right-botar. Målet är att sammanfatta innehållet i dessa tweets med hjälp av ämnesmodellering. Utför ämnesmodellering med 5, 15 och 50 ämnen för att få en uppfattning om hur många ämnen som finns i datamängden.

Den här övningen är en del av kursen

Introduktion till naturlig språkbehandling i R

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]

# Peform topic modeling 
lda_model <- LDA(___, k = ___, method = ___,
                 control = list(seed = 1111))
# Train
___(lda_model, newdata = ___) 
# Test
___(lda_model, newdata = ___) 
Redigera och kör kod