ÎncepețiÎncepe gratuit

Extragerea caracteristicilor și analiza: amzn_pros

amzn_pros_corp, amzn_cons_corp, goog_pros_corp și goog_cons_corp au fost preprocesate, așa că acum poți extrage caracteristicile pe care vrei să le analizezi. Deoarece folosești abordarea bag of words, vei crea un TermDocumentMatrix cu bigraме pentru corpusul recenziilor pozitive ale Amazon, amzn_pros_corp. Pe baza acestuia, poți genera rapid un wordcloud() pentru a înțelege ce expresii asociază oamenii pozitiv cu munca la Amazon.

Funcția de mai jos folosește RWeka pentru a tokeniza câte doi termeni și este utilizată în culise în acest exercițiu.

tokenizer <- function(x) {
  NGramTokenizer(x, Weka_control(min = 2, max = 2))
}

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează amzn_p_tdm ca un TermDocumentMatrix din amzn_pros_corp. Asigură-te că adaugi control = list(tokenize = tokenizer) pentru ca termenii să fie bigrame.
  • Creează amzn_p_tdm_m din amzn_p_tdm folosind funcția as.matrix().
  • Creează amzn_p_freq pentru a obține frecvențele termenilor din amzn_p_tdm_m.
  • Creează un wordcloud() folosind names(amzn_p_freq) ca cuvinte, amzn_p_freq ca frecvențe ale acestora, și max.words = 25 și color = "blue" pentru estetică.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create amzn_p_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_p_tdm_m
___ <- ___

# Create amzn_p_freq
___ <- ___

# Plot a word cloud using amzn_p_freq values
___(___)
Editează și rulează codul