Liczba znaków w rosyjskich tweetach
W tym ćwiczeniu otrzymujesz ramkę danych tweets zawierającą tweety powiązane z rosyjską Agencją Badań Internetowych, opracowane przez FiveThirtyEight.
Twoim zadaniem jest utworzenie nowej cechy 'char_count' w tweets, która oblicza liczbę znaków w każdym tweecie. Oblicz też średnią długość tweeta. Tweety są dostępne w cesze content ramki tweets.
Pamiętaj, że są to prawdziwe dane z Twittera – istnieje ryzyko, że mogą zawierać wulgaryzmy lub inne treści obraźliwe (dotyczy to tego ćwiczenia oraz kolejnych, które również korzystają z rzeczywistych danych z Twittera).
To ćwiczenie jest częścią kursu
Inżynieria cech dla NLP w Pythonie
Instrukcje do ćwiczenia
- Utwórz nową cechę
char_count, stosująclendo cechy'content'ramkitweets. - Wyświetl średnią liczbę znaków w tweetach, obliczając średnią z cechy
'char_count'.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a feature char_count
tweets['char_count'] = tweets[____].apply(____)
# Print the average character count
print(tweets[____].____)