Wyszukiwanie słów kluczowych
Zliczanie znanych słów kluczowych to jeden z pierwszych sposobów analizowania danych tekstowych w zbiorze tweetów. W tym ćwiczeniu sprawdzisz, ile razy określone hashtagi pojawiają się w kolekcji tweetów na temat data science. Wykorzystasz do tego metody stringowe dostępne w obiekcie pandas Series.
pandas i numpy zostały zaimportowane jako pd i np. Rozbudowana wersja funkcji flatten_tweets oraz obiekt data_science_json zostały już załadowane.
To ćwiczenie jest częścią kursu
Analiza danych z mediów społecznościowych w Pythonie
Instrukcje do ćwiczenia
- Spłaszcz tweety za pomocą
flatten_tweets()i zapisz wynik w zmiennejflat_tweets. - Przekształć tweety w DataFrame, korzystając z konstruktora DataFrame biblioteki pandas.
- Znajdź wzmianki o
#pythonw kolumnie'text', ignorując wielkość liter. - Wydrukuj proporcję tweetów wspominających
#python, sumując wartościpythonza pomocąnp.sum()i dzieląc przez łączną liczbę tweetów.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Flatten the tweets and store them
____ = ____(____)
# Convert to DataFrame
ds_tweets = ____.____(____)
# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)
# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)