Vytvoření korpusu a převod na malá písmena
Korpus je seznam textových dokumentů. Text tweetů je potřeba převést do korpusu, aby bylo možné provést další kroky zpracování textu.
Při analýze textu chceme zajistit, aby se jedno slovo nepočítalo jako dvě různá jen proto, že je v různých místech napsáno s různou velikostí písmen. Proto je nutné převést text na malá písmena.
V tomto cvičení vytvoříš textový korpus a převedeš všechny znaky na malá písmena.
Vyčištěný textový výstup z předchozího cvičení je předem načtený jako twts_gsub.
Knihovna tm je pro toto cvičení předem načtená.
Toto cvičení je součástí kurzu
Analýza dat ze sociálních médií v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Convert text in "twt_gsub" dataset to a text corpus and view output
twt_corpus <- twt_gsub %>%
___() %>%
___()
head(twt_corpus$___)