ÎncepețiÎncepe gratuit

Extragerea caracteristicilor și analiză: amzn_cons

Acum decizi să compari rezultatele cu corpusul amzn_cons_corp, folosind un alt TDM bazat pe bigrami. Desigur, te aștepți să vezi expresii diferite în norul de cuvinte.

Vei folosi din nou această funcție personalizată pentru a extrage caracteristicile sub formă de bigrami pentru vizualizare:

tokenizer <- function(x) 
  NGramTokenizer(x, Weka_control(min = 2, max = 2))

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează amzn_c_tdm convertind amzn_cons_corp într-un TermDocumentMatrix și incorporând funcția de bigrami control = list(tokenize = tokenizer).
  • Creează amzn_c_tdm_m ca versiune de tip matrice a lui amzn_c_tdm.
  • Creează amzn_c_freq folosind rowSums() pentru a obține frecvențele termenilor din amzn_c_tdm_m.
  • Creează un wordcloud() folosind names(amzn_c_freq) și valorile amzn_c_freq. Folosește și argumentele max.words = 25 și color = "red".

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create amzn_c_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_c_tdm_m
___ <- ___

# Create amzn_c_freq
___ <- ___

# Plot a word cloud of negative Amazon bigrams
___
Editează și rulează codul