Hledání klíčových slov
Počítání výskytů klíčových slov je jedním z prvních způsobů, jak analyzovat textová data v tweetech. V této datové sadě spočítáš, kolikrát se konkrétní hashtagy objevují v kolekci tweetů o datové vědě. K tomu využiješ řetězcové metody objektu pandas Series.
pandas a numpy jsou importované jako pd a np. K dispozici máš také plně funkční flatten_tweets a data_science_json.
Toto cvičení je součástí kurzu
Analýza dat ze sociálních sítí v Pythonu
Pokyny k cvičení
- Zpracuj tweety pomocí
flatten_tweets()a výsledek ulož doflat_tweets. - Převeď tweety na DataFrame pomocí konstruktoru pandas DataFrame.
- Najdi zmínky o
#pythonve sloupci'text', bez ohledu na velikost písmen. - Vypiš podíl tweetů zmiňujících
#python– sečti hodnoty vpythonpomocínp.sum()a vyděl celkovým počtem tweetů.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Flatten the tweets and store them
____ = ____(____)
# Convert to DataFrame
ds_tweets = ____.____(____)
# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)
# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)