Przetwarzanie tekstu: stemming
Rdzeń słowa jest często ważniejszy niż jego końcówka – szczególnie w analizie tekstu. Książka „Folwark zwierzęcy" jest oczywiście o zwierzętach. Jednak informacja, że słowo animal's pojawia się w niej 248 razy, a animal – 107 razy, może nie być przydatna w analizie.
tidy_animal_farm zawiera tibble ze słowami z „Folwarku zwierzęcego" po tokenizacji i usunięciu stop words. Następnym krokiem jest zastosowanie stemmingu i sprawdzenie wyników.
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Instrukcje do ćwiczenia
- Użyj pakietów
dplyriSnowballC, aby przeprowadzić stemming słów ztidy_animal_farm. - Wyświetl stare częstotliwości słów z
tidy_animal_farm. - Wyświetl nowe częstotliwości słów z
stemmed_animal_farm.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Perform stemming on tidy_animal_farm
stemmed_animal_farm <- tidy_animal_farm %>%
___(word = ___(___))
# Print the old word frequencies
___ %>%
___(word, sort = ___)
# Print the new word frequencies
___ %>%
___(word, sort = ___)