En kort textanalys av tweets
Nu när du har satt upp din DataFrame med tweets ska du göra en enkel textanalys för att räkna hur många tweets som innehåller orden 'clinton', 'trump', 'sanders' och 'cruz'. I koden som körs innan övningen har vi definierat funktionen word_in_text(), som kontrollerar om det första argumentet (ett ord) förekommer i det andra argumentet (en tweet).
import re
def word_in_text(word, text):
word = word.lower()
text = text.lower()
match = re.search(word, text)
if match:
return True
return False
Du ska iterera över raderna i DataFrame:n och beräkna hur många tweets som innehåller vart och ett av nyckelorden! Räknarvariabeln för varje kandidat har initierats till 0.
Den här övningen är en del av kursen
Importera data i Python – fortsättningskurs
Övningsinstruktioner
- I
for-loopenfor index, row in df.iterrows():ökar koden för närvarande värdet avclintonmed1varje gång en tweet (en textrad) som nämner 'Clinton' påträffas. Komplettera koden så att samma sak sker förtrump,sandersochcruz.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Initialize list to store tweet counts
[clinton, trump, sanders, cruz] = [0, 0, 0, 0]
# Iterate through df, counting the number of tweets in which
# each candidate is mentioned
for index, row in df.iterrows():
clinton += word_in_text('clinton', row['text'])
trump += word_in_text(____, ____)
sanders += word_in_text(____, ____)
cruz += word_in_text(____, ____)