ÎncepețiÎncepe gratuit

Matricea de distanțe și dendrograma

O modalitate simplă de a analiza grupurile de cuvinte este cu ajutorul unei dendrograme aplicate pe matricea termen-document. După ce ai o TDM, poți apela dist() pentru a calcula diferențele dintre fiecare rând al matricei.

Următorul pas este să apelezi hclust() pentru a efectua analiza de grupare pe baza disimilarităților din matricea de distanțe. În final, poți vizualiza distanțele dintre frecvențele cuvintelor folosind o dendrogramă și plot(). În text mining, dendrogramele pot releva insight-uri interesante sau grupuri de cuvinte surprinzătoare.

Gândește-te la tabelul cu precipitații anuale pe care l-ai văzut în ultimul video. Cleveland și Portland au aceeași cantitate de precipitații, deci distanța dintre ele este 0. Te-ai aștepta ca cele două orașe să formeze un cluster, iar New Orleans să fie separat, deoarece primește mult mai multă ploaie.

       city rainfall
  Cleveland    39.14
   Portland    39.14
     Boston    43.77
New Orleans    62.45

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

Cadrul de date rain a fost preîncărcat în spațiul tău de lucru.

  • Creează dist_rain folosind funcția dist() pe valorile din a doua coloană a lui rain.
  • Afișează matricea dist_rain în consolă.
  • Creează hc efectuând o analiză de grupare cu hclust() pe dist_rain.
  • Aplică plot() pe obiectul hc cu labels = rain$city pentru a adăuga numele orașelor.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create dist_rain
___ <- ___(___)

# View the distance matrix
___

# Create hc
___ <- ___(___)

# Plot hc
___(___, ___)
Editează și rulează codul