Chercher du texte au mauvais endroit
Rappelez-vous que le texte pertinent ne se trouve pas uniquement dans le champ principal text du tweet. Il peut aussi être dans extended_tweet, retweeted_status ou quoted_status. Nous devons vérifier tous ces champs pour être sûrs d’avoir pris en compte l’ensemble du texte pertinent. Nous le ferons souvent, donc nous allons créer une fonction dédiée.
Les deux premières lignes vérifient si le champ principal text ou le champ extended_tweet contient le texte. À vous de compléter pour les autres cas.
Cet exercice fait partie du cours
<cours>Analyser des données de réseaux sociaux en Python</cours>Instructions de l’exercice
Terminez la fonction check_word_in_tweet en procédant ainsi :
- Vérifiez si le champ
quoted_status-textcontient le mot. - Vérifiez si le champ
quoted_status-extended_tweet-full_textcontient le mot. - Vérifiez si le champ
retweeted_status-textcontient le mot. - Vérifiez si le champ
retweeted_status-extended_tweet-full_textcontient le mot.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
def check_word_in_tweet(word, data):
"""Checks if a word is in a Twitter dataset's text.
Checks text and extended tweet (140+ character tweets) for tweets,
retweets and quoted tweets.
Returns a logical pandas Series.
"""
contains_column = data['text'].str.contains(word, case = False)
contains_column |= data['extended_tweet-full_text'].str.contains(word, case = False)
contains_column |= data[____].str.contains(word, case = False)
contains_column |= data[____].____.____(____, case = False)
contains_column |= data[____].____.____(____, ____)
contains_column |= ____[____].____.____(____, ____)
return contains_column