LoslegenKostenlos starten

Zeichenanzahl russischer Tweets

In dieser Übung bekommst du ein DataFrame tweets, das einige Tweets enthält, die mit der Internet Research Agency Russlands in Verbindung stehen und von FiveThirtyEight zusammengestellt wurden.

Deine Aufgabe ist, ein neues Merkmal 'char_count' in tweets zu erstellen, das die Anzahl der Zeichen für jeden Tweet berechnet. Berechne außerdem die durchschnittliche Länge der Tweets. Die Tweets stehen in der Spalte content von tweets.

Beachte: Das sind echte Twitter-Daten. Es besteht daher immer das Risiko, dass sie Obszönitäten oder andere anstößige Inhalte enthalten (in dieser Übung und in allen folgenden Übungen, die ebenfalls reale Twitter-Daten verwenden).

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering für NLP in Python</Kurs>
Kurs ansehen

Übungsanweisungen

  • Erstelle ein neues Merkmal char_count, indem du len auf die Spalte 'content' von tweets anwendest.
  • Gib die durchschnittliche Zeichenanzahl der Tweets aus, indem du den Mittelwert der Spalte 'char_count' berechnest.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Create a feature char_count
tweets['char_count'] = tweets[____].apply(____)

# Print the average character count
print(tweets[____].____)
Code bearbeiten und ausführen