Odstranění stop slov a nadbytečných mezer
Korpus textu obvykle obsahuje spoustu běžných slov jako „a", „an", „the", „of" nebo „but". V oblasti zpracování přirozeného jazyka se těmto slovům říká stop slova.
Stop slova se při zpracování textu většinou odstraňují, aby bylo možné soustředit se na důležitější slova v korpusu a získat z nich užitečné poznatky.
Po odstranění speciálních znaků, interpunkce, čísel a stop slov vznikají v korpusu také nadbytečné mezery – i těch je potřeba se zbavit.
Korpus, který jsi vytvořil/a v předchozím cvičení, je předem načtený jako twt_corpus_lwr.
Knihovna tm je pro toto cvičení předem načtena.
Toto cvičení je součástí kurzu
Analýza dat ze sociálních médií v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Remove English stop words from the corpus and view the corpus
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)