TM-Auffrischung (II)
Erstellen wir jetzt eine Document Term Matrix (DTM). In einer DTM gilt:
- Jede Zeile der Matrix entspricht einem Dokument.
- Jede Spalte ist ein eindeutiges Wort-Token.
- Die Werte der Matrix geben die Worthäufigkeit in einem einzelnen Dokument an.
Die DTM ist die Grundlage vieler Analysen nach dem Prinzip der Bag-of-Words. Später im Kurs verwendest du außerdem die verwandte Term Document Matrix (TDM). Das ist die Transponierte; das heißt, Spalten stehen für Dokumente und Zeilen für eindeutige Wort-Token.
Du solltest eine DTM nach dem Bereinigen des Korpus (mit clean_corpus()) konstruieren. Rufe dazu DocumentTermMatrix() auf dem Korpus-Objekt auf.
tm_dtm <- DocumentTermMatrix(tm_clean)
Wenn du eine ausführlichere Auffrischung brauchst, schau dir den Kurs Text Mining with Bag-of-Words in R an. Hoffentlich haben dich diese beiden Übungen gut genug vorbereitet, um mit deiner Sentiment-Analyse durchzustarten!
Beachte, dass dies echte Twitter-Daten sind und daher immer das Risiko besteht, dass sie vulgäre oder anderweitig anstößige Inhalte enthalten (in dieser Übung und in allen folgenden Übungen, die ebenfalls echte Twitter-Daten verwenden).
Diese Übung ist Teil des Kurses
<Kurs>Sentimentanalyse in R</Kurs>Übungsanweisungen
Wir haben ein VCorpus()-Objekt namens clean_text erstellt, das 1000 Tweets enthält, in denen Kaffee erwähnt wird. Die Tweets wurden mit den zuvor genannten Preprocessing-Schritten bereinigt, und dein Ziel ist es, daraus eine DTM zu erstellen.
- Wende
DocumentTermMatrix()auf denclean_text-Korpus an, um eine termfrequenzgewichtete DTM namenstf_dtmzu erstellen. - Wandle das
DocumentTermMatrix()-Objekt mitas.matrix()in eine einfache Matrix um. Nenne das neue Objekttf_dtm_m. - Prüfe die Dimensionen der Matrix mit
dim(). - Verwende eckige Klammern zum Indexieren, um einen Teil der Matrix zu sehen.
- Wähle die Zeilen 16 bis 20 und die Spalten 2975 bis 2985 aus
- Notiere dir den Häufigkeitswert des Wortes „working."
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# clean_text is pre-defined
clean_text
# Create tf_dtm
tf_dtm <- ___
# Create tf_dtm_m
tf_dtm_m <- ___
# Dimensions of DTM matrix
___
# Subset part of tf_dtm_m for comparison
___[___, ___]