Trocha textové analýzy tweetů
Teď, když máš DataFrame s tweety připravený, provedeš jednoduchou textovou analýzu – spočítáš, kolik tweetů obsahuje slova 'clinton', 'trump', 'sanders' a 'cruz'. V kódu před cvičením jsme definovali funkci word_in_text(), která zjistí, jestli se první argument (slovo) vyskytuje ve druhém argumentu (tweetu).
import re
def word_in_text(word, text):
word = word.lower()
text = text.lower()
match = re.search(word, text)
if match:
return True
return False
Budeš procházet řádky DataFramu a zjišťovat, kolik tweetů obsahuje každé z hledaných slov! Seznam objektů pro každého kandidáta byl inicializován na hodnotu 0.
Toto cvičení je součástí kurzu
Intermediate Importing Data in Python
Pokyny k cvičení
- Ve smyčce
for index, row in df.iterrows():kód aktuálně zvyšuje hodnotuclintono1pokaždé, když narazí na tweet (textový řádek) zmiňující 'Clinton'; doplň kód tak, aby se stejná logika použila i protrump,sandersacruz.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Initialize list to store tweet counts
[clinton, trump, sanders, cruz] = [0, 0, 0, 0]
# Iterate through df, counting the number of tweets in which
# each candidate is mentioned
for index, row in df.iterrows():
clinton += word_in_text('clinton', row['text'])
trump += word_in_text(____, ____)
sanders += word_in_text(____, ____)
cruz += word_in_text(____, ____)