Przykład modelu klasyfikacji
Wcześniej przygotowano zbiór rosyjskich tweetów do klasyfikacji. Spośród 20 000 tweetów odfiltrowano te z wartością account_type równą Left lub Right i wybrano pierwsze 2000 tweetów każdego rodzaju. Tweety zostały już stokenizowane do postaci słów, usunięto słowa funkcyjne (stop words) i przeprowadzono stemming. Następnie przeliczono liczby wystąpień słów na macierz dokumentów i terminów (document-term matrix) z wagami TFIDF, zapisując ją jako: left_right_matrix_small.
Tę macierz wykorzystasz do przewidzenia, czy dany tweet pochodzi od bota lewicowego, czy prawicowego. Etykiety znajdziesz w wektorze left_right_labels.
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Instrukcje do ćwiczenia
- Ustaw ziarno losowości na
1111, aby zapewnić odtwarzalność wyników. - Utwórz zbiory treningowy i testowy. Użyj 75% próby jako danych treningowych.
- Uruchom model lasu losowego na danych treningowych, używając
left_right_labelsjako wektora odpowiedziy. - Wyświetl wyniki modelu lasu losowego.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
library(randomForest)
# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]
# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)),
y = ___[___],
nTree = 50)
# Print the results
___