Nejčastější termíny s balíčkem tm
Teď, když víš, jak vytvořit term-document matrix i její transponovanou verzi – document-term matrix –, použijeme ji jako základ pro analýzu. Aby se s ní dobře pracovalo, je potřeba ji převést na jednoduchou matici pomocí as.matrix(), stejně jako jsme to dělali v 1. kapitole.
Zavoláním rowSums() na nově vzniklou matici agregujeme výskyty všech termínů v textu. Výsledné součty pak můžeš seřadit pomocí sort() s parametrem decreasing = TRUE a zaměřit se tak na nejčastěji používané termíny.
Nakonec si zobrazíš barplot() s 5 nejčastějšími termíny z term_frequency pomocí následujícího kódu:
barplot(term_frequency[1:5], col = "#C0DE25")
A pokud by ses chtěl/a naučit graf ještě více přizpůsobit, podívej se na naše kurzy ggplot2… :)
Toto cvičení je součástí kurzu
Dolování textu metodou Bag-of-Words v R
Pokyny k cvičení
- Vytvoř
coffee_mjako matici z term-document matrixcoffee_tdmz předchozí kapitoly. - Vytvoř
term_frequencypomocí funkcerowSums()aplikované nacoffee_m. - Seřaď
term_frequencysestupně a výsledek ulož zpět doterm_frequency. - Pomocí indexování jednoduchými hranatými závorkami, tj. pouze jedním
[, vypiš 10 nejčastějších termínů zterm_frequency. - Vytvoř sloupcový graf (barplot) pro 10 nejčastějších termínů.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
## coffee_tdm is still loaded in your workspace
# Convert coffee_tdm to a matrix
coffee_m <- ___
# Calculate the row sums of coffee_m
term_frequency <- ___
# Sort term_frequency in decreasing order
term_frequency <- ___
# View the top 10 most common words
___
# Plot a barchart of the 10 most common words
___(___, col = "tan", las = 2)