Kom igångKom igång gratis

Ett exempel på misslyckad textanalys

Tidigare diskuterade vi hur kraftfullt det är att ta bort stoppord innan man genomför textanalys. I det senaste kapitlet gick vi igenom hur man använder kosinuslikhet för att identifiera texter som liknar varandra.

I den här övningen utforskar du den mycket verkliga risken att använda textanalys på fel sätt. Du beräknar kosinuslikheter för kapitlen i boken Djurfarmen – utan att ta bort stoppord.

Den här övningen är en del av kursen

Introduktion till naturlig språkbehandling i R

Visa kurs

Övningsinstruktioner

  • Granska den angivna koden för att skapa ordräkningar. Det här steget är redan klart.
  • Använd funktionen pairwise_similarity() från widyr för att beräkna kosinuslikheten för varje kapitel i kolumnen chapter.
  • Sortera resultaten med de högsta similarity-värdena först.
  • Beräkna medelvärdet mean av similarity-värdena.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create word counts
animal_farm_counts <- animal_farm %>%
  unnest_tokens(word, text_column) %>%
  count(chapter, word)

# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
  ___(___, ___, n) %>%
  arrange(desc(___))

# Print the mean of the similarity values
comparisons %>%
  summarize(mean = ___(___))
Redigera och kör kod