Macierz odległości i dendrogram
Prostym sposobem na przeprowadzenie analizy skupień słów jest dendrogram oparty na macierzy termów i dokumentów. Gdy masz już macierz TDM, możesz wywołać dist(), aby obliczyć różnice między poszczególnymi wierszami macierzy.
Następnie wywołujesz hclust(), aby przeprowadzić analizę skupień na podstawie różnic z macierzy odległości. Na koniec możesz zwizualizować odległości częstości słów za pomocą dendrogramu i funkcji plot(). W eksploracji tekstu dendrogram często pozwala odkryć ciekawe zależności i grupy powiązanych słów.
Rozważ tabelę rocznych opadów, którą widziałeś w ostatnim filmie. Cleveland i Portland mają taką samą ilość opadów, więc ich odległość wynosi 0. Można się spodziewać, że te dwa miasta utworzą jedno skupienie, a Nowy Orlean znajdzie się osobno – ze względu na znacznie wyższe opady.
city rainfall
Cleveland 39.14
Portland 39.14
Boston 43.77
New Orleans 62.45
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
Ramka danych rain została wcześniej wczytana do twojego środowiska pracy.
- Utwórz
dist_rain, używając funkcjidist()na wartościach z drugiej kolumny ramkirain. - Wyświetl macierz
dist_rainw konsoli. - Utwórz
hc, przeprowadzając analizę skupień za pomocąhclust()na obiekciedist_rain. - Wywołaj
plot()na obiekciehcz argumentemlabels = rain$city, aby dodać nazwy miast.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create dist_rain
___ <- ___(___)
# View the distance matrix
___
# Create hc
___ <- ___(___)
# Plot hc
___(___, ___)