ÎncepețiÎncepe gratuit

Un exemplu de eșec în analiza textului

La începutul cursului, ai discutat despre importanța eliminării cuvintelor de stop înainte de a efectua analiza textului. În cel mai recent capitol, ai recapitulat utilizarea similarității cosinus pentru a identifica texte similare între ele.

În acest exercițiu, vei explora posibilitatea, cât se poate de reală, de a aplica greșit analiza textului. Vei calcula similaritățile cosinus pentru capitolele din cartea Animal Farm, fără a elimina cuvintele de stop.

Acest exercițiu face parte din cursul

Introducere în Prelucrarea Limbajului Natural în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Analizează codul furnizat pentru a crea numărătorile de cuvinte. Această parte a fost deja completată pentru tine.
  • Folosind funcția pairwise_similarity() din widyr, calculează similaritățile cosinus pentru fiecare capitol din coloana chapter.
  • Ordonează rezultatele cu cele mai mari valori de similarity primele.
  • Calculează media (mean) valorilor de similarity.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create word counts
animal_farm_counts <- animal_farm %>%
  unnest_tokens(word, text_column) %>%
  count(chapter, word)

# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
  ___(___, ___, n) %>%
  arrange(desc(___))

# Print the mean of the similarity values
comparisons %>%
  summarize(mean = ___(___))
Editează și rulează codul