LoslegenKostenlos starten

Polaritätsbasierte Korpora erstellen

In dieser Übung führst du Schritt 3 des Text-Mining-Workflows aus. Auch wenn qdap kein Tidy-Paket ist, wirst du mit mutate() eine neue Spalte auf Basis der zurückgegebenen polarity-Liste anlegen, die die Werte für alle Polarität (das ist übrigens ein Hinweis) enthält. In Kapitel 3 haben wir eine benutzerdefinierte Funktion pol_subsections verwendet, die nur Basis-R-Anweisungen nutzt. Im Sinne der Tidy-Prinzipien kommt in dieser Übung jedoch filter() zum Einsatz und anschließend pull(). Die Funktion pull() funktioniert wie [[, um eine einzelne Variable zu extrahieren.

Sobald die Daten getrennt sind, fasst du alle positiven und negativen Kommentare jeweils zu zwei größeren Dokumenten zusammen, die alle Wörter aus den positiven bzw. negativen Mietbewertungen enthalten.

Abschließend erstellst du eine Term-Frequency–Inverse-Document-Frequency-gewichtete (TF-IDF) Term-Dokument-Matrix (TDM). Da der Code in dieser Übung mit einer Tidy-Struktur startet, werden einige Funktionen aus tm zusammen mit dem Operator %>% verwendet, um den Stil konsistent zu halten. Falls dir die Grundlagen des tm-Pakets nicht vertraut sind, wirf einen Blick auf den Kurs Text Mining with Bag-of-Words in R. Anstatt die Häufigkeit eines Wortes einfach zu zählen, werden die Werte in der TDM für übermäßig häufige Terme abgewertet, was dabei hilft, nicht-informative Wörter zu reduzieren.

Diese Übung ist Teil des Kurses

<Kurs>Sentimentanalyse in R</Kurs>
Kurs ansehen

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

pos_terms <- bos_reviews %>%
  # Add polarity column
  ___(polarity = ___) %>%
  # Filter for positive polarity
  ___(___) %>%
  # Extract comments column
  ___(___) %>% 
  # Paste and collapse
  ___(collapse = "___")
Code bearbeiten und ausführen