Rechercher des mots-clés
Compter des mots-clés connus est l’une des premières façons d’analyser du texte dans un jeu de données Twitter. Dans ce jeu de données, vous allez compter le nombre de fois où des hashtags spécifiques apparaissent dans une collection de tweets sur la data science. Pour cela, vous allez utiliser les méthodes de chaînes de caractères des objets Series de pandas.
pandas et numpy ont été importés sous les alias pd et np. Une version plus complète de flatten_tweets ainsi que data_science_json ont également été chargés pour vous.
Cet exercice fait partie du cours
<cours>Analyser des données de réseaux sociaux en Python</cours>Instructions de l’exercice
- Aplatissez les tweets avec
flatten_tweets()et stockez-les dansflat_tweets. - Convertissez les tweets en DataFrame à l’aide du constructeur DataFrame de pandas.
- Recherchez les occurrences de
#pythondans'text', sans tenir compte de la casse. - Affichez la proportion de tweets mentionnant
#pythonen additionnantpythonavecnp.sum()et en la divisant par le nombre total de tweets.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Flatten the tweets and store them
____ = ____(____)
# Convert to DataFrame
ds_tweets = ____.____(____)
# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)
# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)