Krótka analiza tekstu tweetów
Teraz, gdy masz już gotowy DataFrame z tweetami, czas na krótką analizę tekstu – sprawdzisz, ile tweetów zawiera słowa 'clinton', 'trump', 'sanders' i 'cruz'. W kodzie startowym zdefiniowaliśmy funkcję word_in_text(), która sprawdza, czy pierwszy argument (słowo) występuje w drugim argumencie (tweecie).
import re
def word_in_text(word, text):
word = word.lower()
text = text.lower()
match = re.search(word, text)
if match:
return True
return False
Przejdziesz przez wiersze DataFrame i zliczysz, ile tweetów zawiera każde ze słów kluczowych! Lista obiektów dla każdego kandydata została zainicjowana wartością 0.
To ćwiczenie jest częścią kursu
Importowanie danych w Pythonie – poziom średniozaawansowany
Instrukcje do ćwiczenia
- W pętli
for index, row in df.iterrows():kod aktualnie zwiększa wartość zmiennejclintono1za każdym razem, gdy napotkany zostanie tweet (wiersz tekstowy) wspominający o 'Clinton'. Uzupełnij kod tak, aby to samo działo się dla zmiennychtrump,sandersicruz.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Initialize list to store tweet counts
[clinton, trump, sanders, cruz] = [0, 0, 0, 0]
# Iterate through df, counting the number of tweets in which
# each candidate is mentioned
for index, row in df.iterrows():
clinton += word_in_text('clinton', row['text'])
trump += word_in_text(____, ____)
sanders += word_in_text(____, ____)
cruz += word_in_text(____, ____)