Găsirea cuvintelor-cheie
Numărarea cuvintelor-cheie cunoscute este una dintre primele metode prin care poți analiza datele text dintr-un set de tweet-uri. În acest set de date, vei număra de câte ori apar anumite hashtag-uri într-o colecție de tweet-uri despre știința datelor. Pentru aceasta, vei folosi metodele pentru șiruri de caractere din obiectul pandas Series.
pandas și numpy au fost importate ca pd, respectiv np. De asemenea, o versiune mai completă a funcției flatten_tweets și variabila data_science_json au fost încărcate pentru tine.
Acest exercițiu face parte din cursul
Analiza datelor din social media în Python
Instrucțiuni pentru exercițiu
- Aplatizează tweet-urile cu
flatten_tweets()și stochează-le înflat_tweets. - Convertește tweet-urile la DataFrame folosind constructorul pandas DataFrame.
- Găsește mențiunile
#pythonîn'text', ignorând diferența dintre majuscule și minuscule. - Afișează proporția tweet-urilor care menționează
#python, înmulțând sumapythoncunp.sum()și împărțind-o la numărul total de tweet-uri.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Flatten the tweets and store them
____ = ____(____)
# Convert to DataFrame
ds_tweets = ____.____(____)
# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)
# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)