Zacznij terazZacznij za darmo

Przykład błędnej analizy tekstu

Na początku omawialiśmy znaczenie usuwania stop-słów przed przystąpieniem do analizy tekstu. W ostatnim rozdziale poznałeś/aś zastosowanie podobieństwa cosinusowego do identyfikowania podobnych tekstów.

W tym ćwiczeniu sprawdzisz, jak łatwo popełnić błąd w analizie tekstu. Obliczysz podobieństwa cosinusowe dla rozdziałów książki Folwark zwierzęcy – bez usuwania stop-słów.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Przejrzyj dostarczony kod służący do zliczania słów. Ten krok jest już dla ciebie gotowy.
  • Używając funkcji pairwise_similarity() z pakietu widyr, oblicz podobieństwa cosinusowe dla każdego rozdziału w kolumnie chapter.
  • Posortuj wyniki od najwyższych wartości similarity.
  • Oblicz średnią (mean) wartości similarity.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create word counts
animal_farm_counts <- animal_farm %>%
  unnest_tokens(word, text_column) %>%
  count(chapter, word)

# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
  ___(___, ___, n) %>%
  arrange(desc(___))

# Print the mean of the similarity values
comparisons %>%
  summarize(mean = ___(___))
Edytuj i uruchom kod