TM-Auffrischung (I)
Im Kurs Text Mining: Bag of Words hast du gelernt, dass ein Korpus eine Sammlung von Texten ist, und du hast einige Funktionen zur Vorverarbeitung von Texten kennengelernt. Zur Wiederholung: Eine Möglichkeit, einen Korpus zu erstellen und zu bereinigen, ist mit den folgenden Funktionen. Auch wenn dies ein anderer Kurs ist, gehört Sentimentanalyse zum Text Mining – eine Auffrischung kann also hilfreich sein.
- Wandle einen Character-Vektor mit
VectorSource()in eine Textquelle um. - Wandle eine Textquelle mit
VCorpus()in einen Korpus um. - Entferne unerwünschte Zeichen aus dem Korpus mit Bereinigungsfunktionen wie
removePunctuation()undstripWhitespace()austmsowiereplace_abbreviation()ausqdap.
In dieser Übung wurde eine benutzerdefinierte Funktion clean_corpus() erstellt, die gängige Vorverarbeitungsfunktionen für eine einfachere Anwendung bündelt.
clean_corpus() akzeptiert die Ausgabe von VCorpus() und wendet Bereinigungsfunktionen an. Zum Beispiel:
processed_corpus <- clean_corpus(my_corpus)
Diese Übung ist Teil des Kurses
<Kurs>Sentimentanalyse in R</Kurs>Übungsanweisungen
Deine R-Session enthält einen Textvektor tm_define mit zwei kleinen Dokumenten und die Funktion clean_corpus().
- Erzeuge ein Objekt namens
tm_vector, indem duVectorSource()auftm_defineanwendest. - Erzeuge
tm_corpus, indem duVCorpus()auftm_vectoranwendest. - Untersuche mit
content()den Inhalt des ersten Dokuments intm_corpus.- Auf Dokumente im Korpus greifst du mit Listensyntax zu, also mit doppelten eckigen Klammern, z. B.
[[1]].
- Auf Dokumente im Korpus greifst du mit Listensyntax zu, also mit doppelten eckigen Klammern, z. B.
- Bereinige den Korpus-Text, indem du die benutzerdefinierte Funktion
clean_corpus()auftm_corpusanwendest. Nenne dieses neue Objekttm_clean. - Untersuche das erste Dokument des neuen Objekts
tm_cleanerneut, um zu sehen, wie sich der Text nach Anwendung vonclean_corpus()verändert hat.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___