Extragerea caracteristicilor și analiză: amzn_cons
Acum decizi să compari rezultatele cu corpusul amzn_cons_corp, folosind un alt TDM bazat pe bigrami. Desigur, te aștepți să vezi expresii diferite în norul de cuvinte.
Vei folosi din nou această funcție personalizată pentru a extrage caracteristicile sub formă de bigrami pentru vizualizare:
tokenizer <- function(x)
NGramTokenizer(x, Weka_control(min = 2, max = 2))
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
- Creează
amzn_c_tdmconvertindamzn_cons_corpîntr-unTermDocumentMatrixși incorporând funcția de bigramicontrol = list(tokenize = tokenizer). - Creează
amzn_c_tdm_mca versiune de tip matrice a luiamzn_c_tdm. - Creează
amzn_c_freqfolosindrowSums()pentru a obține frecvențele termenilor dinamzn_c_tdm_m. - Creează un
wordcloud()folosindnames(amzn_c_freq)și valorileamzn_c_freq. Folosește și argumentelemax.words = 25șicolor = "red".
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Create amzn_c_tdm_m
___ <- ___
# Create amzn_c_freq
___ <- ___
# Plot a word cloud of negative Amazon bigrams
___