LoslegenKostenlos starten

TM-Auffrischung (II)

Erstellen wir jetzt eine Document Term Matrix (DTM). In einer DTM gilt:

  • Jede Zeile der Matrix entspricht einem Dokument.
  • Jede Spalte ist ein eindeutiges Wort-Token.
  • Die Werte der Matrix geben die Worthäufigkeit in einem einzelnen Dokument an.

Die DTM ist die Grundlage vieler Analysen nach dem Prinzip der Bag-of-Words. Später im Kurs verwendest du außerdem die verwandte Term Document Matrix (TDM). Das ist die Transponierte; das heißt, Spalten stehen für Dokumente und Zeilen für eindeutige Wort-Token.

Du solltest eine DTM nach dem Bereinigen des Korpus (mit clean_corpus()) konstruieren. Rufe dazu DocumentTermMatrix() auf dem Korpus-Objekt auf.

tm_dtm <- DocumentTermMatrix(tm_clean)

Wenn du eine ausführlichere Auffrischung brauchst, schau dir den Kurs Text Mining with Bag-of-Words in R an. Hoffentlich haben dich diese beiden Übungen gut genug vorbereitet, um mit deiner Sentiment-Analyse durchzustarten!

Beachte, dass dies echte Twitter-Daten sind und daher immer das Risiko besteht, dass sie vulgäre oder anderweitig anstößige Inhalte enthalten (in dieser Übung und in allen folgenden Übungen, die ebenfalls echte Twitter-Daten verwenden).

Diese Übung ist Teil des Kurses

<Kurs>Sentimentanalyse in R</Kurs>
Kurs ansehen

Übungsanweisungen

Wir haben ein VCorpus()-Objekt namens clean_text erstellt, das 1000 Tweets enthält, in denen Kaffee erwähnt wird. Die Tweets wurden mit den zuvor genannten Preprocessing-Schritten bereinigt, und dein Ziel ist es, daraus eine DTM zu erstellen.

  • Wende DocumentTermMatrix() auf den clean_text-Korpus an, um eine termfrequenzgewichtete DTM namens tf_dtm zu erstellen.
  • Wandle das DocumentTermMatrix()-Objekt mit as.matrix() in eine einfache Matrix um. Nenne das neue Objekt tf_dtm_m.
  • Prüfe die Dimensionen der Matrix mit dim().
  • Verwende eckige Klammern zum Indexieren, um einen Teil der Matrix zu sehen.
  • Wähle die Zeilen 16 bis 20 und die Spalten 2975 bis 2985 aus
  • Notiere dir den Häufigkeitswert des Wortes „working."

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# clean_text is pre-defined
clean_text

# Create tf_dtm
tf_dtm <- ___

# Create tf_dtm_m
tf_dtm_m <- ___

# Dimensions of DTM matrix
___

# Subset part of tf_dtm_m for comparison
___[___, ___]
Code bearbeiten und ausführen