Zacznij terazZacznij za darmo

Przetwarzanie tekstu: stemming

Rdzeń słowa jest często ważniejszy niż jego końcówka – szczególnie w analizie tekstu. Książka „Folwark zwierzęcy" jest oczywiście o zwierzętach. Jednak informacja, że słowo animal's pojawia się w niej 248 razy, a animal – 107 razy, może nie być przydatna w analizie.

tidy_animal_farm zawiera tibble ze słowami z „Folwarku zwierzęcego" po tokenizacji i usunięciu stop words. Następnym krokiem jest zastosowanie stemmingu i sprawdzenie wyników.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj pakietów dplyr i SnowballC, aby przeprowadzić stemming słów z tidy_animal_farm.
  • Wyświetl stare częstotliwości słów z tidy_animal_farm.
  • Wyświetl nowe częstotliwości słów z stemmed_animal_farm.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Perform stemming on tidy_animal_farm
stemmed_animal_farm <- tidy_animal_farm %>%
  ___(word = ___(___))

# Print the old word frequencies 
___ %>%
  ___(word, sort = ___)

# Print the new word frequencies
___ %>%
  ___(word, sort = ___)
Edytuj i uruchom kod