Un exemplu de eșec în analiza textului
La începutul cursului, ai discutat despre importanța eliminării cuvintelor de stop înainte de a efectua analiza textului. În cel mai recent capitol, ai recapitulat utilizarea similarității cosinus pentru a identifica texte similare între ele.
În acest exercițiu, vei explora posibilitatea, cât se poate de reală, de a aplica greșit analiza textului. Vei calcula similaritățile cosinus pentru capitolele din cartea Animal Farm, fără a elimina cuvintele de stop.
Acest exercițiu face parte din cursul
Introducere în Prelucrarea Limbajului Natural în R
Instrucțiuni pentru exercițiu
- Analizează codul furnizat pentru a crea numărătorile de cuvinte. Această parte a fost deja completată pentru tine.
- Folosind funcția
pairwise_similarity()dinwidyr, calculează similaritățile cosinus pentru fiecare capitol din coloanachapter. - Ordonează rezultatele cu cele mai mari valori de
similarityprimele. - Calculează media (
mean) valorilor desimilarity.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create word counts
animal_farm_counts <- animal_farm %>%
unnest_tokens(word, text_column) %>%
count(chapter, word)
# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
___(___, ___, n) %>%
arrange(desc(___))
# Print the mean of the similarity values
comparisons %>%
summarize(mean = ___(___))