Kom igångKom igång gratis

Exempel på klassificeringsmodellering

Du har tidigare förberett en uppsättning ryska tweets för klassificering. Av de 20 000 tweetsen har du filtrerat fram tweets med ett account_type som är Left eller Right, och valt ut de första 2 000 tweetsen från varje kategori. Du har redan tokeniserat tweetsen till ord, tagit bort stoppord och utfört stemming. Dessutom har du konverterat ordräkningar till en dokument-termmatris med TFIDF-värden som vikter och sparat denna matris som: left_right_matrix_small.

Du kommer att använda denna matris för att förutsäga om en tweet genererades av en vänstersinnad eller högersinnad tweetbot. Etiketterna finns i vektorn left_right_labels.

Den här övningen är en del av kursen

Introduktion till naturlig språkbehandling i R

Visa kurs

Övningsinstruktioner

  • Ange det slumpmässiga fröet till 1111 för reproducerbarhet.
  • Skapa tränings- och testdatamängder. Använd ett urval på 75 % för träningsdata.
  • Kör en random forest-modell på träningsdata och använd left_right_labels som svarsvektorn y.
  • Skriv ut resultaten från random forest-modellen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

library(randomForest)

# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]

# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)), 
                    y = ___[___],
                    nTree = 50)
# Print the results
___
Redigera och kör kod