Pune totul cap la cap: o dendrogramă bazată pe text
A venit momentul să îți pui abilitățile la lucru și să creezi prima ta dendrogramă bazată pe text. Ține minte că dendrogramele reduc informația pentru a te ajuta să înțelegi datele – similar cu modul în care o medie îți spune ceva despre o populație, dar nu totul. Ambele pot induce în eroare. În cazul textelor, apar adesea multe grupuri fără sens, dar pot apărea și grupuri valoroase.
O particularitate a obiectelor TDM și DTM este că trebuie să le convertești mai întâi în matrici (cu as.matrix()), înainte de a le folosi cu funcția dist().
În cazul tweet-urilor despre chardonnay, poate ai fost surprins să îl vezi pe legendarul artist de soul Marvin Gaye apărând în norul de cuvinte. Să vedem dacă dendrograma identifică același lucru.
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
- Creează
tweets_tdm2aplicândremoveSparseTerms()petweets_tdm. Foloseștesparse = 0.975. - Creează
tdm_mfolosindas.matrix()petweets_tdm2pentru a-l converti în format matrice. - Creează
tweets_distcare să conțină distanțele dintdm_mfolosind funcțiadist(). - Creează un obiect de clustering ierarhic numit
hcfolosindhclust()petweets_dist. - Generează o dendrogramă cu
plot()șihc.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create tweets_tdm2
___ <- ___(___, ___)
# Create tdm_m
___ <- ___(___)
# Create tweets_dist
___ <- ___(___)
# Create hc
___ <- ___(___)
# Plot the dendrogram
___(___)