Začněte nyníZačněte zdarma

Stop slova a word cloudy

Teď, když přemýšlíš stylem text miningu a v ruce máš sklenici chardonnay, je čas jít trochu hlouběji. V předchozím word cloudu dominovalo slovo „chardonnay" natolik, že ostatní zajímavé poznatky zanikly.

Přidáme „chardonnay" mezi stop slova a zjistíme, která další slova jsou běžná, ale dosud přehlušená.

V tvém pracovním prostředí je už připravená vyčištěná verze tweetů o chardonnay. Teď odebereme některé neinformativní výrazy. V tomto cvičení ti funkce content() ukáže konkrétní tweet pro porovnání. Nezapomeň použít dvojité závorky pro indexování listu korpusu.

Toto cvičení je součástí kurzu

Dolování textu metodou Bag-of-Words v R

Zobrazit kurz

Pokyny k cvičení

  • Aplikuj content() na 24. dokument v chardonnay_corp.
  • Přidej "chardonnay" k anglickým stop slovům a výsledek ulož do stops.
  • Prohlédni si posledních šest slov v stops.
  • Vytvoř cleaned_chardonnay_corp pomocí tm_map() – předej jí chardonnay_corp, funkci removeWords() a stop slova stops.
  • Znovu zobraz obsah (content) 24. tweetu a porovnej výsledky.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Review a "cleaned" tweet
___(___)

# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')

# Review last 6 stopwords 
tail(stops)

# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)

# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])
Upravit a spustit kód