Aan de slagBegin gratis

Zoeken naar trefwoorden

Het tellen van bekende trefwoorden is een van de eerste manieren waarop je tekstdgegevens in een Twitter-gegevensset kunt analyseren. In deze gegevensset ga je tellen hoe vaak specifieke hashtags voorkomen in een verzameling tweets over data science. Hiervoor ga je de stringmethoden in het pandas Series-object gebruiken.

pandas en numpy zijn geïmporteerd als respectievelijk pd en np. Een meer uitgebreide flatten_tweets en data_science_json zijn ook voor je geladen.

Deze oefening maakt deel uit van de cursus

Socialmediagegevens analyseren in Python

Bekijk cursus

Oefeninstructies

  • Maak de tweets vlak met flatten_tweets() en sla ze op in flat_tweets.
  • Zet tweets om naar een DataFrame met de pandas DataFrame-constructor.
  • Zoek vermeldingen van #python in 'text', zonder op hoofdletters te letten.
  • Print het aandeel tweets dat #python noemt door python op te tellen met np.sum() en dit te delen door het totale aantal tweets.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Flatten the tweets and store them
____ = ____(____)

# Convert to DataFrame
ds_tweets = ____.____(____)

# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)

# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)
Code bewerken en uitvoeren