Chercher du texte au mauvais endroit
Rappelez-vous que le texte pertinent ne se trouve pas seulement dans le champ principal text du gazouillis. Il peut aussi être dans extended_tweet, retweeted_status ou quoted_status. Nous devons vérifier tous ces champs pour nous assurer d'avoir pris en compte tout le texte pertinent. Comme nous devrons le faire souvent, nous allons créer une fonction qui s'en charge.
Les deux premières lignes vérifient si le champ principal text ou extended_tweet contient le texte. À vous de vérifier le reste.
Cette activité fait partie du cours
Analyser des données de médias sociaux avec Python
Instructions de l’exercice
Terminez la fonction check_word_in_tweet en effectuant les actions suivantes :
- Vérifiez si le champ
quoted_status-textcontient le mot. - Vérifiez si le champ
quoted_status-extended_tweet-full_textcontient le mot. - Vérifiez si le champ
retweeted_status-textcontient le mot. - Vérifiez si le champ
retweeted_status-extended_tweet-full_textcontient le mot.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
def check_word_in_tweet(word, data):
"""Checks if a word is in a Twitter dataset's text.
Checks text and extended tweet (140+ character tweets) for tweets,
retweets and quoted tweets.
Returns a logical pandas Series.
"""
contains_column = data['text'].str.contains(word, case = False)
contains_column |= data['extended_tweet-full_text'].str.contains(word, case = False)
contains_column |= data[____].str.contains(word, case = False)
contains_column |= data[____].____.____(____, case = False)
contains_column |= data[____].____.____(____, ____)
contains_column |= ____[____].____.____(____, ____)
return contains_column