CommencerCommencez gratuitement

Rechercher des mots-clés

Compter des mots-clés connus est l’une des premières façons d’analyser du texte dans un jeu de données Twitter. Dans ce jeu de données, vous allez compter le nombre de fois où des hashtags spécifiques apparaissent dans une collection de tweets sur la data science. Pour cela, vous allez utiliser les méthodes de chaînes de caractères des objets Series de pandas.

pandas et numpy ont été importés sous les alias pd et np. Une version plus complète de flatten_tweets ainsi que data_science_json ont également été chargés pour vous.

Cet exercice fait partie du cours

<cours>Analyser des données de réseaux sociaux en Python</cours>
Voir le cours

Instructions de l’exercice

  • Aplatissez les tweets avec flatten_tweets() et stockez-les dans flat_tweets.
  • Convertissez les tweets en DataFrame à l’aide du constructeur DataFrame de pandas.
  • Recherchez les occurrences de #python dans 'text', sans tenir compte de la casse.
  • Affichez la proportion de tweets mentionnant #python en additionnant python avec np.sum() et en la divisant par le nombre total de tweets.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Flatten the tweets and store them
____ = ____(____)

# Convert to DataFrame
ds_tweets = ____.____(____)

# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)

# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)
Modifier et exécuter le code