Najczęstsze terminy z tm
Wiesz już, jak tworzyć macierz term-dokument oraz jej transpozycję – macierz dokument-term. Teraz wykorzystamy je jako podstawę do analizy. Żeby przeprowadzić analizę, musimy przekształcić macierz na prostą macierz, tak jak w rozdziale 1, używając as.matrix().
Wywołanie rowSums() na nowo utworzonej macierzy agreguje wszystkie terminy użyte w tekście. Po obliczeniu rowSums() możesz posortować wyniki za pomocą sort() z argumentem decreasing = TRUE, aby skupić się na najczęściej występujących terminach.
Na koniec możesz utworzyć barplot() dla 5 najczęstszych terminów z term_frequency, używając poniższego kodu.
barplot(term_frequency[1:5], col = "#C0DE25")
Oczywiście możesz zajrzeć do naszych kursów ggplot2, żeby nauczyć się jeszcze bardziej dostosowywać wykresy… :)
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
- Utwórz
coffee_mjako macierz na podstawie macierzy term-dokumentcoffee_tdmz poprzedniego rozdziału. - Utwórz
term_frequency, stosując funkcjęrowSums()nacoffee_m. - Posortuj
term_frequencyw kolejności malejącej i zapisz wynik wterm_frequency. - Użyj indeksowania za pomocą pojedynczego nawiasu kwadratowego, tzn. tylko jednego
[, aby wyświetlić 10 najczęstszych terminów zterm_frequency. - Utwórz wykres słupkowy dla 10 najczęstszych terminów.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
## coffee_tdm is still loaded in your workspace
# Convert coffee_tdm to a matrix
coffee_m <- ___
# Calculate the row sums of coffee_m
term_frequency <- ___
# Sort term_frequency in decreasing order
term_frequency <- ___
# View the top 10 most common words
___
# Plot a barchart of the 10 most common words
___(___, col = "tan", las = 2)