ÎncepețiÎncepe gratuit

Creează un TDM potrivit pentru dendrogramă

Acum că înțelegi pașii necesari pentru a crea o dendrogramă, îi poți aplica pe date text. Dar mai întâi, trebuie să limitezi numărul de cuvinte din TDM folosind removeSparseTerms() din tm. De ce ai vrea să ajustezi raritatea unui TDM/DTM?

TDM-urile și DTM-urile sunt rare (sparse), adică conțin în mare parte zerouri. Ține minte că 1.000 de tweet-uri pot genera un TDM cu peste 3.000 de termeni! O dendrogramă atât de aglomerată va fi greu de interpretat, mai ales când lucrezi cu volume mari de text.

În majoritatea contextelor profesionale, o dendrogramă bună se bazează pe un TDM cu 25 până la 70 de termeni. Mai mult de 70 de termeni poate face vizualizarea aglomerată și greu de înțeles. În schimb, mai puțin de 25 de termeni înseamnă că dendrograma ta s-ar putea să nu evidențieze clustere relevante și utile.

Când folosești removeSparseTerms(), parametrul sparse controlează câți termeni sunt păstrați în TDM. Cu cât valoarea sparse este mai apropiată de 1, cu atât mai mulți termeni sunt păstrați. Această valoare reprezintă un prag procentual al zerourilor pentru fiecare termen din TDM.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

tweets_tdm a fost creat pe baza tweet-urilor despre chardonnay.

  • Afișează în consolă dimensiunile lui tweets_tdm.
  • Creează tdm1 folosind removeSparseTerms() cu sparse = 0.95 aplicat pe tweets_tdm.
  • Creează tdm2 folosind removeSparseTerms() cu sparse = 0.975 aplicat pe tweets_tdm.
  • Afișează tdm1 în consolă pentru a vedea câți termeni au rămas.
  • Afișează tdm2 în consolă pentru a vedea câți termeni au rămas.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Print the dimensions of tweets_tdm
___

# Create tdm1
___ <- ___(___, ___)

# Create tdm2
___ <- ___(___, ___)

# Print tdm1
___

# Print tdm2
___
Editează și rulează codul