LoslegenKostenlos starten

Schritt 2: Textquellen identifizieren

In dieser kurzen Übung lädst und untersuchst du ein kleines Korpus von Bewertungen zu Mietobjekten rund um Boston. Hoffentlich kennst du bereits read.csv(), womit du eine kommagetrennte Datei laden kannst. Das wirkt vielleicht unspektakulär, aber Ziel dieses Kapitels ist es, dich einmal durch einen kompletten Workflow von Anfang bis Ende zu führen – also los geht's mit der Datenaufnahme!

Als Nächstes wendest du einfach str() an, um die structure des Data Frames zu betrachten. Das ist eine praktische Funktion, die kompakt Anfangswerte und Klassentypen von Vektoren anzeigt.

Zum Schluss verwendest du dim(), um die dimensions des Data Frames auszugeben. Bei einem Data Frame zeigt dir die Konsole die Anzahl der Zeilen und die Anzahl der Spalten an.

Andere Funktionen wie head(), tail() oder summary() werden häufig für die Datenexploration genutzt. In diesem Fall halten wir die Prüfung jedoch kurz, damit du schneller zur eigentlichen Sentiment-Analyse kommst!

Diese Übung ist Teil des Kurses

<Kurs>Sentimentanalyse in R</Kurs>
Kurs ansehen

Übungsanweisungen

Die Bewertungen zu Mietobjekten in Boston liegen in einer CSV-Datei, die über die vordefinierte Variable bos_reviews_file referenziert wird.

  • Lade die Bewertungen aus bos_reviews_file mit read.csv(). Nenne das Objekt bos_reviews.
  • Untersuche die Struktur des Data Frames mit der Base-Funktion str() angewendet auf bos_reviews.
  • Finde heraus, mit wie vielen Bewertungen du arbeitest, indem du dim() auf bos_reviews aufrufst.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# bos_reviews_file has been pre-defined
bos_reviews_file

# load raw text
bos_reviews <- ___

# Structure
___

# Dimensions
___
Code bearbeiten und ausführen