ÎncepețiÎncepe gratuit

Exemplu de modelare a clasificării

Anterior, ai pregătit un set de tweet-uri în rusă pentru clasificare. Din cele 20.000 de tweet-uri, le-ai filtrat pe cele cu account_type egal cu Left sau Right și ai selectat primele 2.000 de tweet-uri din fiecare categorie. Ai tokenizat deja tweet-urile în cuvinte, ai eliminat cuvintele de oprire și ai aplicat stemming. În plus, ai convertit numărul de apariții ale cuvintelor într-o matrice document-termen cu valori TFIDF ca ponderi și ai salvat această matrice ca: left_right_matrix_small.

Vei folosi această matrice pentru a prezice dacă un tweet a fost generat de un bot cu orientare de stânga sau de dreapta. Etichetele se găsesc în vectorul left_right_labels.

Acest exercițiu face parte din cursul

Introducere în Prelucrarea Limbajului Natural în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Setează sămânța aleatoare la 1111 pentru reproductibilitate.
  • Creează seturile de date de antrenament și de testare. Folosește un eșantion de 75% pentru datele de antrenament.
  • Rulează un model de tip random forest pe datele de antrenament și folosește left_right_labels pentru vectorul de răspuns y.
  • Afișează rezultatele modelului random forest.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

library(randomForest)

# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]

# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)), 
                    y = ___[___],
                    nTree = 50)
# Print the results
___
Editează și rulează codul