ÎncepețiÎncepe gratuit

Găsirea cuvintelor-cheie

Numărarea cuvintelor-cheie cunoscute este una dintre primele metode prin care poți analiza datele text dintr-un set de tweet-uri. În acest set de date, vei număra de câte ori apar anumite hashtag-uri într-o colecție de tweet-uri despre știința datelor. Pentru aceasta, vei folosi metodele pentru șiruri de caractere din obiectul pandas Series.

pandas și numpy au fost importate ca pd, respectiv np. De asemenea, o versiune mai completă a funcției flatten_tweets și variabila data_science_json au fost încărcate pentru tine.

Acest exercițiu face parte din cursul

Analiza datelor din social media în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Aplatizează tweet-urile cu flatten_tweets() și stochează-le în flat_tweets.
  • Convertește tweet-urile la DataFrame folosind constructorul pandas DataFrame.
  • Găsește mențiunile #python în 'text', ignorând diferența dintre majuscule și minuscule.
  • Afișează proporția tweet-urilor care menționează #python, înmulțând suma python cu np.sum() și împărțind-o la numărul total de tweet-uri.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Flatten the tweets and store them
____ = ____(____)

# Convert to DataFrame
ds_tweets = ____.____(____)

# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)

# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)
Editează și rulează codul