Przykład błędnej analizy tekstu
Na początku omawialiśmy znaczenie usuwania stop-słów przed przystąpieniem do analizy tekstu. W ostatnim rozdziale poznałeś/aś zastosowanie podobieństwa cosinusowego do identyfikowania podobnych tekstów.
W tym ćwiczeniu sprawdzisz, jak łatwo popełnić błąd w analizie tekstu. Obliczysz podobieństwa cosinusowe dla rozdziałów książki Folwark zwierzęcy – bez usuwania stop-słów.
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Instrukcje do ćwiczenia
- Przejrzyj dostarczony kod służący do zliczania słów. Ten krok jest już dla ciebie gotowy.
- Używając funkcji
pairwise_similarity()z pakietuwidyr, oblicz podobieństwa cosinusowe dla każdego rozdziału w kolumniechapter. - Posortuj wyniki od najwyższych wartości
similarity. - Oblicz średnią (
mean) wartościsimilarity.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create word counts
animal_farm_counts <- animal_farm %>%
unnest_tokens(word, text_column) %>%
count(chapter, word)
# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
___(___, ___, n) %>%
arrange(desc(___))
# Print the mean of the similarity values
comparisons %>%
summarize(mean = ___(___))