Zoeken naar tekst op de verkeerde plekken
Denk eraan dat relevante tekst niet alleen in het hoofdveld text van de tweet staat. Het kan ook in extended_tweet, retweeted_status of quoted_status zitten. We moeten al deze velden controleren om zeker te weten dat we alle relevante tekst meenemen. We doen dit vaak, dus we maken een functie die dit voor ons doet.
De eerste twee regels controleren of het hoofdveld text of de extended_tweet de tekst bevat. Jij controleert de rest.
Deze oefening maakt deel uit van de cursus
Socialmediagegevens analyseren in Python
Oefeninstructies
Maak de functie check_word_in_tweet af door het volgende te doen:
- Controleer of het veld
quoted_status-texthet woord bevat. - Controleer of het veld
quoted_status-extended_tweet-full_texthet woord bevat. - Controleer of het veld
retweeted_status-texthet woord bevat. - Controleer of het veld
retweeted_status-extended_tweet-full_texthet woord bevat.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
def check_word_in_tweet(word, data):
"""Checks if a word is in a Twitter dataset's text.
Checks text and extended tweet (140+ character tweets) for tweets,
retweets and quoted tweets.
Returns a logical pandas Series.
"""
contains_column = data['text'].str.contains(word, case = False)
contains_column |= data['extended_tweet-full_text'].str.contains(word, case = False)
contains_column |= data[____].str.contains(word, case = False)
contains_column |= data[____].____.____(____, case = False)
contains_column |= data[____].____.____(____, ____)
contains_column |= ____[____].____.____(____, ____)
return contains_column