Začněte nyníZačněte zdarma

Odstranění stop slov a nadbytečných mezer

Korpus textu obvykle obsahuje spoustu běžných slov jako „a", „an", „the", „of" nebo „but". V oblasti zpracování přirozeného jazyka se těmto slovům říká stop slova.

Stop slova se při zpracování textu většinou odstraňují, aby bylo možné soustředit se na důležitější slova v korpusu a získat z nich užitečné poznatky.

Po odstranění speciálních znaků, interpunkce, čísel a stop slov vznikají v korpusu také nadbytečné mezery – i těch je potřeba se zbavit.

Korpus, který jsi vytvořil/a v předchozím cvičení, je předem načtený jako twt_corpus_lwr.

Knihovna tm je pro toto cvičení předem načtena.

Toto cvičení je součástí kurzu

Analýza dat ze sociálních médií v R

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Remove English stop words from the corpus and view the corpus 
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)
Upravit a spustit kód