CommencezCommencez gratuitement

Repérer des mots-clés

Le comptage de mots-clés connus est l'une des premières façons d'analyser du texte dans un jeu de données Twitter. Dans ce jeu de données, vous allez compter le nombre de fois où des mots-clics précis apparaissent dans une collection de tweets sur la science des données. Pour y parvenir, vous utiliserez les méthodes de chaîne de caractères des objets Series de pandas.

pandas et numpy ont été importés comme pd et np, respectivement. Une version plus complète de flatten_tweets et data_science_json a également été chargée pour vous.

Cette activité fait partie du cours

Analyser des données de médias sociaux avec Python

Voir le cours

Instructions de l’exercice

  • Aplatissez les tweets avec flatten_tweets() et stockez-les dans flat_tweets.
  • Convertissez les tweets en DataFrame à l'aide du constructeur DataFrame de pandas.
  • Repérez les mentions de #python dans 'text', sans tenir compte de la casse.
  • Affichez la proportion de tweets mentionnant #python en additionnant python avec np.sum() et en la divisant par le nombre total de tweets.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Flatten the tweets and store them
____ = ____(____)

# Convert to DataFrame
ds_tweets = ____.____(____)

# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)

# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)
Modifier et exécuter le code