ÎncepețiÎncepe gratuit

Pune totul cap la cap: o dendrogramă bazată pe text

A venit momentul să îți pui abilitățile la lucru și să creezi prima ta dendrogramă bazată pe text. Ține minte că dendrogramele reduc informația pentru a te ajuta să înțelegi datele – similar cu modul în care o medie îți spune ceva despre o populație, dar nu totul. Ambele pot induce în eroare. În cazul textelor, apar adesea multe grupuri fără sens, dar pot apărea și grupuri valoroase.

O particularitate a obiectelor TDM și DTM este că trebuie să le convertești mai întâi în matrici (cu as.matrix()), înainte de a le folosi cu funcția dist().

În cazul tweet-urilor despre chardonnay, poate ai fost surprins să îl vezi pe legendarul artist de soul Marvin Gaye apărând în norul de cuvinte. Să vedem dacă dendrograma identifică același lucru.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează tweets_tdm2 aplicând removeSparseTerms() pe tweets_tdm. Folosește sparse = 0.975.
  • Creează tdm_m folosind as.matrix() pe tweets_tdm2 pentru a-l converti în format matrice.
  • Creează tweets_dist care să conțină distanțele din tdm_m folosind funcția dist().
  • Creează un obiect de clustering ierarhic numit hc folosind hclust() pe tweets_dist.
  • Generează o dendrogramă cu plot() și hc.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create tweets_tdm2
___ <- ___(___, ___)

# Create tdm_m
___ <- ___(___)

# Create tweets_dist
___ <- ___(___)

# Create hc
___ <- ___(___)

# Plot the dendrogram
___(___)
Editează și rulează codul