ÎncepețiÎncepe gratuit

O mică analiză a textului de pe Twitter

Acum că ai creat DataFrame-ul cu tweet-uri, vei face o mică analiză de text pentru a număra câte tweet-uri conțin cuvintele 'clinton', 'trump', 'sanders' și 'cruz'. În codul pre-exercițiu am definit funcția word_in_text(), care verifică dacă primul argument (un cuvânt) apare în cel de-al doilea argument (un tweet).

import re

def word_in_text(word, text):
    word = word.lower()
    text = text.lower()
    match = re.search(word, text)

    if match:
        return True
    return False

Vei parcurge rândurile DataFrame-ului și vei calcula câte tweet-uri conțin fiecare dintre cuvintele cheie! Lista de valori pentru fiecare candidat a fost inițializată la 0.

Acest exercițiu face parte din cursul

Importul intermediar de date în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • În interiorul buclei for index, row in df.iterrows():, codul crește în prezent valoarea lui clinton cu 1 de fiecare dată când este întâlnit un tweet (rând de text) care menționează 'Clinton'; completează codul astfel încât același lucru să se întâmple și pentru trump, sanders și cruz.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Initialize list to store tweet counts
[clinton, trump, sanders, cruz] = [0, 0, 0, 0]

# Iterate through df, counting the number of tweets in which
# each candidate is mentioned
for index, row in df.iterrows():
    clinton += word_in_text('clinton', row['text'])
    trump += word_in_text(____, ____)
    sanders += word_in_text(____, ____)
    cruz += word_in_text(____, ____)
Editează și rulează codul