Stop slova a word cloudy
Teď, když přemýšlíš stylem text miningu a v ruce máš sklenici chardonnay, je čas jít trochu hlouběji. V předchozím word cloudu dominovalo slovo „chardonnay" natolik, že ostatní zajímavé poznatky zanikly.
Přidáme „chardonnay" mezi stop slova a zjistíme, která další slova jsou běžná, ale dosud přehlušená.
V tvém pracovním prostředí je už připravená vyčištěná verze tweetů o chardonnay. Teď odebereme některé neinformativní výrazy. V tomto cvičení ti funkce content() ukáže konkrétní tweet pro porovnání. Nezapomeň použít dvojité závorky pro indexování listu korpusu.
Toto cvičení je součástí kurzu
Dolování textu metodou Bag-of-Words v R
Pokyny k cvičení
- Aplikuj
content()na 24. dokument vchardonnay_corp. - Přidej
"chardonnay"k anglickým stop slovům a výsledek ulož dostops. - Prohlédni si posledních šest slov v
stops. - Vytvoř
cleaned_chardonnay_corppomocítm_map()– předej jíchardonnay_corp, funkciremoveWords()a stop slovastops. - Znovu zobraz obsah (
content) 24. tweetu a porovnej výsledky.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Review a "cleaned" tweet
___(___)
# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')
# Review last 6 stopwords
tail(stops)
# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)
# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])