Začněte nyníZačněte zdarma

Příklad klasifikačního modelu

V předchozím cvičení jsi připravil/a sadu ruských tweetů pro klasifikaci. Z celkových 20 000 tweetů jsi vyfiltroval/a ty s hodnotou account_type rovnou Left nebo Right a vybral/a prvních 2 000 tweetů od každého typu. Tweety jsi tokenizoval/a na jednotlivá slova, odstranil/a stopslova a provedl/a stemming. Dále jsi převedl/a četnosti slov na matici dokumentů a termínů s váhami TFIDF a tuto matici uložil/a jako: left_right_matrix_small.

Tuto matici teď využiješ k predikci toho, zda tweet pochází od levicového, nebo pravicového tweetovacího bota. Popisky najdeš ve vektoru left_right_labels.

Toto cvičení je součástí kurzu

Úvod do zpracování přirozeného jazyka v R

Zobrazit kurz

Pokyny k cvičení

  • Nastav náhodné semínko na hodnotu 1111 pro zajištění reprodukovatelnosti.
  • Vytvoř trénovací a testovací datové sady. Pro trénovací data použij 75% vzorek.
  • Spusť model náhodného lesa na trénovacích datech a jako vektor odpovědí y použij left_right_labels.
  • Vypiš výsledky modelu náhodného lesa.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

library(randomForest)

# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]

# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)), 
                    y = ___[___],
                    nTree = 50)
# Print the results
___
Upravit a spustit kód