Extragerea caracteristicilor și analiza: amzn_pros
amzn_pros_corp, amzn_cons_corp, goog_pros_corp și goog_cons_corp au fost preprocesate, așa că acum poți extrage caracteristicile pe care vrei să le analizezi. Deoarece folosești abordarea bag of words, vei crea un TermDocumentMatrix cu bigraме pentru corpusul recenziilor pozitive ale Amazon, amzn_pros_corp. Pe baza acestuia, poți genera rapid un wordcloud() pentru a înțelege ce expresii asociază oamenii pozitiv cu munca la Amazon.
Funcția de mai jos folosește RWeka pentru a tokeniza câte doi termeni și este utilizată în culise în acest exercițiu.
tokenizer <- function(x) {
NGramTokenizer(x, Weka_control(min = 2, max = 2))
}
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
- Creează
amzn_p_tdmca unTermDocumentMatrixdinamzn_pros_corp. Asigură-te că adaugicontrol = list(tokenize = tokenizer)pentru ca termenii să fie bigrame. - Creează
amzn_p_tdm_mdinamzn_p_tdmfolosind funcțiaas.matrix(). - Creează
amzn_p_freqpentru a obține frecvențele termenilor dinamzn_p_tdm_m. - Creează un
wordcloud()folosindnames(amzn_p_freq)ca cuvinte,amzn_p_freqca frecvențe ale acestora, șimax.words = 25șicolor = "blue"pentru estetică.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_tdm_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Plot a word cloud using amzn_p_freq values
___(___)