Termeni frecvenți cu tm
Acum că știi cum să creezi o matrice de termeni-documente, precum și transpusa acesteia – matricea de documente-termeni – o vom folosi ca bază pentru analiză. Pentru a o analiza, trebuie să o convertim într-o matrice simplă, așa cum am făcut în capitolul 1 folosind as.matrix().
Aplicând rowSums() pe matricea nou creată, agregăm toți termenii folosiți într-un pasaj. Odată ce ai rowSums(), poți sorta rezultatele cu sort() folosind decreasing = TRUE, astfel încât să te concentrezi pe cei mai frecvenți termeni.
În final, poți genera un barplot() cu primii 5 termeni din term_frequency folosind următorul cod.
barplot(term_frequency[1:5], col = "#C0DE25")
Bineînțeles, poți urma cursurile noastre de ggplot2 pentru a personaliza graficul și mai mult… :)
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
- Creează
coffee_mca matrice folosind matricea de termeni-documentecoffee_tdmdin capitolul anterior. - Creează
term_frequencyfolosind funcțiarowSums()aplicată pecoffee_m. - Sortează
term_frequencyîn ordine descrescătoare și stochează rezultatul înterm_frequency. - Folosește indexarea cu paranteze pătrate simple, adică un singur
[, pentru a afișa primii 10 termeni dinterm_frequency. - Creează un barplot cu primii 10 termeni.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
## coffee_tdm is still loaded in your workspace
# Convert coffee_tdm to a matrix
coffee_m <- ___
# Calculate the row sums of coffee_m
term_frequency <- ___
# Sort term_frequency in decreasing order
term_frequency <- ___
# View the top 10 most common words
___
# Plot a barchart of the 10 most common words
___(___, col = "tan", las = 2)