Ekstrakcja cech i analiza: amzn_pros
amzn_pros_corp, amzn_cons_corp, goog_pros_corp i goog_cons_corp zostały już przetworzone wstępnie, więc możesz teraz wyodrębnić interesujące cię cechy. Ponieważ korzystasz z podejścia bag of words, tworzysz bigramową TermDocumentMatrix dla korpusu pozytywnych recenzji Amazon – amzn_pros_corp. Na jej podstawie szybko wygenerujesz wordcloud(), który pokaże, jakie frazy pracownicy kojarzą pozytywnie z pracą w Amazon.
Poniższa funkcja używa RWeka do tokenizacji par wyrazów i działa w tle podczas tego ćwiczenia.
tokenizer <- function(x) {
NGramTokenizer(x, Weka_control(min = 2, max = 2))
}
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
- Utwórz
amzn_p_tdmjakoTermDocumentMatrixna podstawieamzn_pros_corp. Pamiętaj, aby dodaćcontrol = list(tokenize = tokenizer), tak żeby terminy były bigramami. - Utwórz
amzn_p_tdm_mzamzn_p_tdm, używając funkcjias.matrix(). - Utwórz
amzn_p_freq, aby uzyskać częstości terminów zamzn_p_tdm_m. - Utwórz
wordcloud(), używającnames(amzn_p_freq)jako słów,amzn_p_freqjako ich częstości orazmax.words = 25icolor = "blue"dla efektu wizualnego.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_tdm_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Plot a word cloud using amzn_p_freq values
___(___)