Matricea de distanțe și dendrograma
O modalitate simplă de a analiza grupurile de cuvinte este cu ajutorul unei dendrograme aplicate pe matricea termen-document. După ce ai o TDM, poți apela dist() pentru a calcula diferențele dintre fiecare rând al matricei.
Următorul pas este să apelezi hclust() pentru a efectua analiza de grupare pe baza disimilarităților din matricea de distanțe. În final, poți vizualiza distanțele dintre frecvențele cuvintelor folosind o dendrogramă și plot(). În text mining, dendrogramele pot releva insight-uri interesante sau grupuri de cuvinte surprinzătoare.
Gândește-te la tabelul cu precipitații anuale pe care l-ai văzut în ultimul video. Cleveland și Portland au aceeași cantitate de precipitații, deci distanța dintre ele este 0. Te-ai aștepta ca cele două orașe să formeze un cluster, iar New Orleans să fie separat, deoarece primește mult mai multă ploaie.
city rainfall
Cleveland 39.14
Portland 39.14
Boston 43.77
New Orleans 62.45
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
Cadrul de date rain a fost preîncărcat în spațiul tău de lucru.
- Creează
dist_rainfolosind funcțiadist()pe valorile din a doua coloană a luirain. - Afișează matricea
dist_rainîn consolă. - Creează
hcefectuând o analiză de grupare cuhclust()pedist_rain. - Aplică
plot()pe obiectulhcculabels = rain$citypentru a adăuga numele orașelor.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create dist_rain
___ <- ___(___)
# View the distance matrix
___
# Create hc
___ <- ___(___)
# Plot hc
___(___, ___)