Zoeken naar trefwoorden
Het tellen van bekende trefwoorden is een van de eerste manieren waarop je tekstdgegevens in een Twitter-gegevensset kunt analyseren. In deze gegevensset ga je tellen hoe vaak specifieke hashtags voorkomen in een verzameling tweets over data science. Hiervoor ga je de stringmethoden in het pandas Series-object gebruiken.
pandas en numpy zijn geïmporteerd als respectievelijk pd en np. Een meer uitgebreide flatten_tweets en data_science_json zijn ook voor je geladen.
Deze oefening maakt deel uit van de cursus
Socialmediagegevens analyseren in Python
Oefeninstructies
- Maak de tweets vlak met
flatten_tweets()en sla ze op inflat_tweets. - Zet tweets om naar een DataFrame met de pandas DataFrame-constructor.
- Zoek vermeldingen van
#pythonin'text', zonder op hoofdletters te letten. - Print het aandeel tweets dat
#pythonnoemt doorpythonop te tellen metnp.sum()en dit te delen door het totale aantal tweets.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Flatten the tweets and store them
____ = ____(____)
# Convert to DataFrame
ds_tweets = ____.____(____)
# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)
# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)