Ekstrakcja cech i analiza: amzn_cons
Teraz postanawiasz zestawić to z korpusem amzn_cons_corp w kolejnej macierzy TDM z bigramami. Spodziewaj się, że w chmurze słów pojawią się nieco inne wyrażenia.
Ponownie skorzystasz z tej własnej funkcji, aby wyodrębnić cechy bigramowe do wizualizacji:
tokenizer <- function(x)
NGramTokenizer(x, Weka_control(min = 2, max = 2))
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
- Utwórz
amzn_c_tdm, konwertującamzn_cons_corpnaTermDocumentMatrixz uwzględnieniem funkcji bigramowejcontrol = list(tokenize = tokenizer). - Utwórz
amzn_c_tdm_mjako wersję macierzowąamzn_c_tdm. - Utwórz
amzn_c_freq, używającrowSums()do obliczenia częstości terminów zamzn_c_tdm_m. - Utwórz
wordcloud(), używającnames(amzn_c_freq)oraz wartościamzn_c_freq. Dodaj również argumentymax.words = 25icolor = "red".
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Create amzn_c_tdm_m
___ <- ___
# Create amzn_c_freq
___ <- ___
# Plot a word cloud of negative Amazon bigrams
___