Začněte nyníZačněte zdarma

Příklad selhání při analýze textu

Na začátku kurzu jsme si ukázali, jak důležité je odstranit stop slova před analýzou textu. V této kapitole jsi pak pracoval/a s kosinovou podobností pro porovnávání textů.

V tomto cvičení si vyzkoušíš, co se stane, když analýzu textu neprovedeš správně. Spočítáš kosinovou podobnost kapitol knihy Farma zvířat – tentokrát bez odstranění stop slov.

Toto cvičení je součástí kurzu

Úvod do zpracování přirozeného jazyka v R

Zobrazit kurz

Pokyny k cvičení

  • Projdi si připravený kód pro výpočet počtu slov – tato část je už hotová.
  • Pomocí funkce pairwise_similarity() z balíčku widyr vypočítej kosinovou podobnost pro každou kapitolu ve sloupci chapter.
  • Seřaď výsledky od nejvyšší hodnoty similarity po nejnižší.
  • Vypočítej průměr mean hodnot similarity.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create word counts
animal_farm_counts <- animal_farm %>%
  unnest_tokens(word, text_column) %>%
  count(chapter, word)

# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
  ___(___, ___, n) %>%
  arrange(desc(___))

# Print the mean of the similarity values
comparisons %>%
  summarize(mean = ___(___))
Upravit a spustit kód