Aan de slagBegin gratis

Zoeken naar tekst op de verkeerde plekken

Denk eraan dat relevante tekst niet alleen in het hoofdveld text van de tweet staat. Het kan ook in extended_tweet, retweeted_status of quoted_status zitten. We moeten al deze velden controleren om zeker te weten dat we alle relevante tekst meenemen. We doen dit vaak, dus we maken een functie die dit voor ons doet.

De eerste twee regels controleren of het hoofdveld text of de extended_tweet de tekst bevat. Jij controleert de rest.

Deze oefening maakt deel uit van de cursus

Socialmediagegevens analyseren in Python

Bekijk cursus

Oefeninstructies

Maak de functie check_word_in_tweet af door het volgende te doen:

  • Controleer of het veld quoted_status-text het woord bevat.
  • Controleer of het veld quoted_status-extended_tweet-full_text het woord bevat.
  • Controleer of het veld retweeted_status-text het woord bevat.
  • Controleer of het veld retweeted_status-extended_tweet-full_text het woord bevat.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

def check_word_in_tweet(word, data):
    """Checks if a word is in a Twitter dataset's text. 
    Checks text and extended tweet (140+ character tweets) for tweets,
    retweets and quoted tweets.
    Returns a logical pandas Series.
    """
    contains_column = data['text'].str.contains(word, case = False)
    contains_column |= data['extended_tweet-full_text'].str.contains(word, case = False)
    contains_column |= data[____].str.contains(word, case = False)
    contains_column |= data[____].____.____(____, case = False)
    contains_column |= data[____].____.____(____, ____)
    contains_column |= ____[____].____.____(____, ____)
    return contains_column
Code bewerken en uitvoeren