Căutând text în locuri nepotrivite
Reține că textul relevant nu se află neapărat în câmpul principal text al tweet-ului. El poate apărea și în extended_tweet, retweeted_status sau quoted_status. Trebuie să verificăm toate aceste câmpuri pentru a ne asigura că am luat în calcul tot textul relevant. Vom face acest lucru des, așa că vom crea o funcție care să se ocupe de asta.
Primele două linii verifică dacă câmpul principal text sau extended_tweet conțin textul căutat. Va trebui să verifici restul câmpurilor.
Acest exercițiu face parte din cursul
Analiza datelor din social media în Python
Instrucțiuni pentru exercițiu
Completează funcția check_word_in_tweet efectuând următorii pași:
- Verifică dacă câmpul
quoted_status-textconține cuvântul. - Verifică dacă câmpul
quoted_status-extended_tweet-full_textconține cuvântul. - Verifică dacă câmpul
retweeted_status-textconține cuvântul. - Verifică dacă câmpul
retweeted_status-extended_tweet-full_textconține cuvântul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
def check_word_in_tweet(word, data):
"""Checks if a word is in a Twitter dataset's text.
Checks text and extended tweet (140+ character tweets) for tweets,
retweets and quoted tweets.
Returns a logical pandas Series.
"""
contains_column = data['text'].str.contains(word, case = False)
contains_column |= data['extended_tweet-full_text'].str.contains(word, case = False)
contains_column |= data[____].str.contains(word, case = False)
contains_column |= data[____].____.____(____, case = False)
contains_column |= data[____].____.____(____, ____)
contains_column |= ____[____].____.____(____, ____)
return contains_column