Przygotuj TDM przyjazny dendrogramowi
Skoro wiesz już, jak tworzyć dendrogram, możesz zastosować tę wiedzę w praktyce. Najpierw jednak musisz ograniczyć liczbę słów w TDM za pomocą funkcji removeSparseTerms() z pakietu tm. Po co w ogóle dostosowywać rzadkość TDM/DTM?
TDM i DTM są rzadkie – oznacza to, że zawierają głównie zera. Warto pamiętać, że 1000 tweetów może dać TDM z ponad 3000 terminów! Dendrogram z tak dużą liczbą elementów byłby bardzo trudny do odczytania – szczególnie przy większych zbiorach tekstu.
W praktyce zawodowej dobry dendrogram opiera się na TDM zawierającym od 25 do 70 terminów. Powyżej 70 terminów wizualizacja staje się zagracona i nieczytelna. Poniżej 25 terminów dendrogram może nie ujawnić istotnych i wartościowych klastrów.
W funkcji removeSparseTerms() parametr sparse kontroluje liczbę terminów pozostawionych w TDM. Im bliżej 1, tym więcej terminów zostaje zachowanych. Wartość ta reprezentuje próg odcięcia – określa maksymalny odsetek zer dopuszczalnych dla każdego terminu w TDM.
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
tweets_tdm został utworzony na podstawie tweetów o chardonnay.
- Wyświetl wymiary
tweets_tdmw konsoli. - Utwórz
tdm1, stosującremoveSparseTerms()z parametremsparse = 0.95natweets_tdm. - Utwórz
tdm2, stosującremoveSparseTerms()z parametremsparse = 0.975natweets_tdm. - Wyświetl
tdm1w konsoli, aby sprawdzić, ile terminów pozostało. - Wyświetl
tdm2w konsoli, aby sprawdzić, ile terminów pozostało.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print the dimensions of tweets_tdm
___
# Create tdm1
___ <- ___(___, ___)
# Create tdm2
___ <- ___(___, ___)
# Print tdm1
___
# Print tdm2
___