Stoppwörter und zusätzliche Leerzeichen entfernen
Ein Textkorpus enthält üblicherweise viele häufige Wörter wie „a“, „an“, „the“, „of“ und „but“. In der Sprachverarbeitung nennt man diese Stoppwörter.
Stoppwörter werden in der Regel während der Textverarbeitung entfernt, damit du dich auf wichtigere Wörter im Korpus konzentrieren kannst, um Erkenntnisse zu gewinnen.
Außerdem müssen die zusätzlichen Leerzeichen, die beim Entfernen von Sonderzeichen, Satzzeichen, Zahlen und Stoppwörtern entstehen, aus dem Korpus entfernt werden.
Der Korpus, den du in der letzten Übung erstellt hast, wurde als twt_corpus_lwr vorab geladen.
Die Bibliothek tm wurde für diese Übung vorab geladen.
Diese Übung ist Teil des Kurses
<Kurs>Social-Media-Daten mit R analysieren</Kurs>Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Remove English stop words from the corpus and view the corpus
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)