ÎncepețiÎncepe gratuit

Termeni frecvenți cu tm

Acum că știi cum să creezi o matrice de termeni-documente, precum și transpusa acesteia – matricea de documente-termeni – o vom folosi ca bază pentru analiză. Pentru a o analiza, trebuie să o convertim într-o matrice simplă, așa cum am făcut în capitolul 1 folosind as.matrix().

Aplicând rowSums() pe matricea nou creată, agregăm toți termenii folosiți într-un pasaj. Odată ce ai rowSums(), poți sorta rezultatele cu sort() folosind decreasing = TRUE, astfel încât să te concentrezi pe cei mai frecvenți termeni.

În final, poți genera un barplot() cu primii 5 termeni din term_frequency folosind următorul cod.

barplot(term_frequency[1:5], col = "#C0DE25")

Bineînțeles, poți urma cursurile noastre de ggplot2 pentru a personaliza graficul și mai mult… :)

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează coffee_m ca matrice folosind matricea de termeni-documente coffee_tdm din capitolul anterior.
  • Creează term_frequency folosind funcția rowSums() aplicată pe coffee_m.
  • Sortează term_frequency în ordine descrescătoare și stochează rezultatul în term_frequency.
  • Folosește indexarea cu paranteze pătrate simple, adică un singur [, pentru a afișa primii 10 termeni din term_frequency.
  • Creează un barplot cu primii 10 termeni.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

## coffee_tdm is still loaded in your workspace

# Convert coffee_tdm to a matrix
coffee_m <- ___

# Calculate the row sums of coffee_m
term_frequency <- ___

# Sort term_frequency in decreasing order
term_frequency <- ___

# View the top 10 most common words
___

# Plot a barchart of the 10 most common words
___(___, col = "tan", las = 2)
Editează și rulează codul