Extrakce příznaků a analýza: amzn_cons
Teď se podíváš na srovnání s korpusem amzn_cons_corp pomocí dalšího bigramového TDM. V word cloudu samozřejmě očekávej jiné fráze.
K extrakci bigramových příznaků pro vizualizaci opět použiješ tuto vlastní funkci:
tokenizer <- function(x)
NGramTokenizer(x, Weka_control(min = 2, max = 2))
Toto cvičení je součástí kurzu
Dolování textu metodou Bag-of-Words v R
Pokyny k cvičení
- Vytvoř
amzn_c_tdmpřevodemamzn_cons_corpnaTermDocumentMatrixs bigramovou funkcícontrol = list(tokenize = tokenizer). - Vytvoř
amzn_c_tdm_mjako maticovou verziamzn_c_tdm. - Vytvoř
amzn_c_freqpomocírowSums()pro získání četností termů zamzn_c_tdm_m. - Vytvoř
wordcloud()s použitímnames(amzn_c_freq)a hodnotamzn_c_freq. Přidej také argumentymax.words = 25acolor = "red".
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Create amzn_c_tdm_m
___ <- ___
# Create amzn_c_freq
___ <- ___
# Plot a word cloud of negative Amazon bigrams
___