LoslegenKostenlos starten

TM-Auffrischung (I)

Im Kurs Text Mining: Bag of Words hast du gelernt, dass ein Korpus eine Sammlung von Texten ist, und du hast einige Funktionen zur Vorverarbeitung von Texten kennengelernt. Zur Wiederholung: Eine Möglichkeit, einen Korpus zu erstellen und zu bereinigen, ist mit den folgenden Funktionen. Auch wenn dies ein anderer Kurs ist, gehört Sentimentanalyse zum Text Mining – eine Auffrischung kann also hilfreich sein.

In dieser Übung wurde eine benutzerdefinierte Funktion clean_corpus() erstellt, die gängige Vorverarbeitungsfunktionen für eine einfachere Anwendung bündelt.

clean_corpus() akzeptiert die Ausgabe von VCorpus() und wendet Bereinigungsfunktionen an. Zum Beispiel:

processed_corpus <- clean_corpus(my_corpus)

Diese Übung ist Teil des Kurses

<Kurs>Sentimentanalyse in R</Kurs>
Kurs ansehen

Übungsanweisungen

Deine R-Session enthält einen Textvektor tm_define mit zwei kleinen Dokumenten und die Funktion clean_corpus().

  • Erzeuge ein Objekt namens tm_vector, indem du VectorSource() auf tm_define anwendest.
  • Erzeuge tm_corpus, indem du VCorpus() auf tm_vector anwendest.
  • Untersuche mit content() den Inhalt des ersten Dokuments in tm_corpus.
    • Auf Dokumente im Korpus greifst du mit Listensyntax zu, also mit doppelten eckigen Klammern, z. B. [[1]].
  • Bereinige den Korpus-Text, indem du die benutzerdefinierte Funktion clean_corpus() auf tm_corpus anwendest. Nenne dieses neue Objekt tm_clean.
  • Untersuche das erste Dokument des neuen Objekts tm_clean erneut, um zu sehen, wie sich der Text nach Anwendung von clean_corpus() verändert hat.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
Code bearbeiten und ausführen