Repérer des mots-clés
Le comptage de mots-clés connus est l'une des premières façons d'analyser du texte dans un jeu de données Twitter. Dans ce jeu de données, vous allez compter le nombre de fois où des mots-clics précis apparaissent dans une collection de tweets sur la science des données. Pour y parvenir, vous utiliserez les méthodes de chaîne de caractères des objets Series de pandas.
pandas et numpy ont été importés comme pd et np, respectivement. Une version plus complète de flatten_tweets et data_science_json a également été chargée pour vous.
Cette activité fait partie du cours
Analyser des données de médias sociaux avec Python
Instructions de l’exercice
- Aplatissez les tweets avec
flatten_tweets()et stockez-les dansflat_tweets. - Convertissez les tweets en DataFrame à l'aide du constructeur DataFrame de pandas.
- Repérez les mentions de
#pythondans'text', sans tenir compte de la casse. - Affichez la proportion de tweets mentionnant
#pythonen additionnantpythonavecnp.sum()et en la divisant par le nombre total de tweets.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Flatten the tweets and store them
____ = ____(____)
# Convert to DataFrame
ds_tweets = ____.____(____)
# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)
# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)