Deux-croisillons et mentions dans des tweets en russe
Revenons au dataframe tweets qui contient des tweets en russe. Dans cet exercice, vous allez calculer le nombre de deux-croisillons et de mentions dans chaque tweet en définissant deux fonctions, count_hashtags() et count_mentions(), puis en les appliquant à la caractéristique content de tweets.
Au besoin, rappelez-vous que les tweets se trouvent dans la caractéristique content de tweets.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le NLP en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Function that returns numner of hashtags in a string
def count_hashtags(string):
# Split the string into words
words = string.split()
# Create a list of words that are hashtags
hashtags = [word for word in words if ____.____(____)]
# Return number of hashtags
return(len(hashtags))
# Create a feature hashtag_count and display distribution
tweets['hashtag_count'] = tweets['content'].apply(count_hashtags)
tweets['hashtag_count'].hist()
plt.title('Hashtag count distribution')
plt.show()