Ett exempel på misslyckad textanalys
Tidigare diskuterade vi hur kraftfullt det är att ta bort stoppord innan man genomför textanalys. I det senaste kapitlet gick vi igenom hur man använder kosinuslikhet för att identifiera texter som liknar varandra.
I den här övningen utforskar du den mycket verkliga risken att använda textanalys på fel sätt. Du beräknar kosinuslikheter för kapitlen i boken Djurfarmen – utan att ta bort stoppord.
Den här övningen är en del av kursen
Introduktion till naturlig språkbehandling i R
Övningsinstruktioner
- Granska den angivna koden för att skapa ordräkningar. Det här steget är redan klart.
- Använd funktionen
pairwise_similarity()frånwidyrför att beräkna kosinuslikheten för varje kapitel i kolumnenchapter. - Sortera resultaten med de högsta
similarity-värdena först. - Beräkna medelvärdet
meanavsimilarity-värdena.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create word counts
animal_farm_counts <- animal_farm %>%
unnest_tokens(word, text_column) %>%
count(chapter, word)
# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
___(___, ___, n) %>%
arrange(desc(___))
# Print the mean of the similarity values
comparisons %>%
summarize(mean = ___(___))