Exemplu de modelare a clasificării
Anterior, ai pregătit un set de tweet-uri în rusă pentru clasificare. Din cele 20.000 de tweet-uri, le-ai filtrat pe cele cu account_type egal cu Left sau Right și ai selectat primele 2.000 de tweet-uri din fiecare categorie. Ai tokenizat deja tweet-urile în cuvinte, ai eliminat cuvintele de oprire și ai aplicat stemming. În plus, ai convertit numărul de apariții ale cuvintelor într-o matrice document-termen cu valori TFIDF ca ponderi și ai salvat această matrice ca: left_right_matrix_small.
Vei folosi această matrice pentru a prezice dacă un tweet a fost generat de un bot cu orientare de stânga sau de dreapta. Etichetele se găsesc în vectorul left_right_labels.
Acest exercițiu face parte din cursul
Introducere în Prelucrarea Limbajului Natural în R
Instrucțiuni pentru exercițiu
- Setează sămânța aleatoare la
1111pentru reproductibilitate. - Creează seturile de date de antrenament și de testare. Folosește un eșantion de 75% pentru datele de antrenament.
- Rulează un model de tip random forest pe datele de antrenament și folosește
left_right_labelspentru vectorul de răspunsy. - Afișează rezultatele modelului random forest.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
library(randomForest)
# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]
# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)),
y = ___[___],
nTree = 50)
# Print the results
___