Creează un TDM potrivit pentru dendrogramă
Acum că înțelegi pașii necesari pentru a crea o dendrogramă, îi poți aplica pe date text. Dar mai întâi, trebuie să limitezi numărul de cuvinte din TDM folosind removeSparseTerms() din tm. De ce ai vrea să ajustezi raritatea unui TDM/DTM?
TDM-urile și DTM-urile sunt rare (sparse), adică conțin în mare parte zerouri. Ține minte că 1.000 de tweet-uri pot genera un TDM cu peste 3.000 de termeni! O dendrogramă atât de aglomerată va fi greu de interpretat, mai ales când lucrezi cu volume mari de text.
În majoritatea contextelor profesionale, o dendrogramă bună se bazează pe un TDM cu 25 până la 70 de termeni. Mai mult de 70 de termeni poate face vizualizarea aglomerată și greu de înțeles. În schimb, mai puțin de 25 de termeni înseamnă că dendrograma ta s-ar putea să nu evidențieze clustere relevante și utile.
Când folosești removeSparseTerms(), parametrul sparse controlează câți termeni sunt păstrați în TDM. Cu cât valoarea sparse este mai apropiată de 1, cu atât mai mulți termeni sunt păstrați. Această valoare reprezintă un prag procentual al zerourilor pentru fiecare termen din TDM.
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
tweets_tdm a fost creat pe baza tweet-urilor despre chardonnay.
- Afișează în consolă dimensiunile lui
tweets_tdm. - Creează
tdm1folosindremoveSparseTerms()cusparse = 0.95aplicat petweets_tdm. - Creează
tdm2folosindremoveSparseTerms()cusparse = 0.975aplicat petweets_tdm. - Afișează
tdm1în consolă pentru a vedea câți termeni au rămas. - Afișează
tdm2în consolă pentru a vedea câți termeni au rămas.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Print the dimensions of tweets_tdm
___
# Create tdm1
___ <- ___(___, ___)
# Create tdm2
___ <- ___(___, ___)
# Print tdm1
___
# Print tdm2
___