Příklad selhání při analýze textu
Na začátku kurzu jsme si ukázali, jak důležité je odstranit stop slova před analýzou textu. V této kapitole jsi pak pracoval/a s kosinovou podobností pro porovnávání textů.
V tomto cvičení si vyzkoušíš, co se stane, když analýzu textu neprovedeš správně. Spočítáš kosinovou podobnost kapitol knihy Farma zvířat – tentokrát bez odstranění stop slov.
Toto cvičení je součástí kurzu
Úvod do zpracování přirozeného jazyka v R
Pokyny k cvičení
- Projdi si připravený kód pro výpočet počtu slov – tato část je už hotová.
- Pomocí funkce
pairwise_similarity()z balíčkuwidyrvypočítej kosinovou podobnost pro každou kapitolu ve sloupcichapter. - Seřaď výsledky od nejvyšší hodnoty
similaritypo nejnižší. - Vypočítej průměr
meanhodnotsimilarity.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create word counts
animal_farm_counts <- animal_farm %>%
unnest_tokens(word, text_column) %>%
count(chapter, word)
# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
___(___, ___, n) %>%
arrange(desc(___))
# Print the mean of the similarity values
comparisons %>%
summarize(mean = ___(___))