Nombre de caractères des tweets russes
Dans cet exercice, on vous fournit un dataframe tweets qui contient des tweets associés à l'Internet Research Agency de la Russie et compilés par FiveThirtyEight.
Votre tâche est de créer une nouvelle caractéristique « char_count » dans tweets qui calcule le nombre de caractères pour chaque tweet. Calculez aussi la longueur moyenne des tweets. Les tweets se trouvent dans la caractéristique content de tweets.
Sachez qu'il s'agit de données réelles provenant de Twitter et qu'il y a donc un risque qu'elles contiennent des grossièretés ou d'autres contenus offensants (dans cet exercice et dans tout exercice ultérieur qui utilise aussi de vraies données Twitter).
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le NLP en Python
Instructions de l’exercice
- Créez une nouvelle caractéristique
char_counten appliquantlenà la caractéristique « content » detweets. - Affichez le nombre moyen de caractères des tweets en calculant la moyenne de la caractéristique « char_count ».
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a feature char_count
tweets['char_count'] = tweets[____].apply(____)
# Print the average character count
print(tweets[____].____)