Asocierea cuvintelor
Așa cum era de așteptat, observi teme similare în tot dendrograma. Revenind la comentariile pozitive, decizi să analizezi expresiile frecvente care au apărut în nori de cuvinte. Speri să găsești termeni asociați folosind funcția findAssocs() din tm. Acum că ai aflat despre orele lungi și lipsa echilibrului dintre viața profesională și cea personală, vrei să cauți ceva surprinzător.
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
Corpusul amzn_pros_corp a fost curățat folosind funcțiile personalizate, ca înainte.
- Construiește un TDM numit
amzn_p_tdmdinamzn_pros_corpșicontrol = list(tokenize = tokenizer). - Creează
amzn_p_mconvertindamzn_p_tdmîntr-o matrice. - Creează
amzn_p_freqaplicândrowSums()peamzn_p_m. - Creează
term_frequencyfolosindsort()peamzn_p_freqîmpreună cu argumentuldecreasing = TRUE. - Examinează primele 5 bigramuri folosind
term_frequency[1:5]. - S-ar putea să fii surprins să vezi „fast paced" printre termenii de top, deoarece ar putea fi un termen negativ legat de „orele lungi". Uită-te la termenii cel mai frecvent asociați cu „fast paced". Folosește
findAssocs()peamzn_p_tdmpentru a examina"fast paced"cu un prag de0.2.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Create term_frequency
___ <- ___
# Print the 5 most common terms
___
# Find associations with fast-paced
___