ÎncepețiÎncepe gratuit

Asocierea cuvintelor

Așa cum era de așteptat, observi teme similare în tot dendrograma. Revenind la comentariile pozitive, decizi să analizezi expresiile frecvente care au apărut în nori de cuvinte. Speri să găsești termeni asociați folosind funcția findAssocs() din tm. Acum că ai aflat despre orele lungi și lipsa echilibrului dintre viața profesională și cea personală, vrei să cauți ceva surprinzător.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

Corpusul amzn_pros_corp a fost curățat folosind funcțiile personalizate, ca înainte.

  • Construiește un TDM numit amzn_p_tdm din amzn_pros_corp și control = list(tokenize = tokenizer).
  • Creează amzn_p_m convertind amzn_p_tdm într-o matrice.
  • Creează amzn_p_freq aplicând rowSums() pe amzn_p_m.
  • Creează term_frequency folosind sort() pe amzn_p_freq împreună cu argumentul decreasing = TRUE.
  • Examinează primele 5 bigramuri folosind term_frequency[1:5].
  • S-ar putea să fii surprins să vezi „fast paced" printre termenii de top, deoarece ar putea fi un termen negativ legat de „orele lungi". Uită-te la termenii cel mai frecvent asociați cu „fast paced". Folosește findAssocs() pe amzn_p_tdm pentru a examina "fast paced" cu un prag de 0.2.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create amzn_p_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_p_m
___ <- ___

# Create amzn_p_freq
___ <- ___

# Create term_frequency
___ <- ___

# Print the 5 most common terms
___

# Find associations with fast-paced
___
Editează și rulează codul