Načtení tweetů do DataFrame
Teď přišel čas načíst data do pandas DataFrame, abychom mohli analyzovat tweety ve větším měřítku.
Budeme pracovat s datasetem tweetů obsahujících hashtag '#rstats' nebo '#python'. Tento dataset je uložen jako seznam tweet JSON objektů v proměnné data_science_json.
Tento kurz se dotýká mnoha konceptů, na které možná nemáš úplně čerstvé vzpomínky – pokud budeš někdy potřebovat rychlé osvěžení, stáhni si tahák pro základy pandas a měj ho po ruce!
Upozorňujeme, že jde o reálná data z Twitteru, a proto vždy existuje riziko výskytu vulgárních nebo jinak nevhodných výrazů (v tomto cvičení i v dalších cvičeních pracujících s reálnými daty z Twitteru).
Toto cvičení je součástí kurzu
Analýza dat ze sociálních sítí v Pythonu
Pokyny k cvičení
- Importuj
pandas(nezapomeň, že podle konvence ho aliasujeme jakopd). - Zpracuj tweety z
data_science_jsonpomocíflatten_tweets()a ulož je do proměnnétweets. - Vytvoř DataFrame z proměnné
tweetspomocípd.DataFrame(). - Vypiš text prvních 5 tweetů.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import pandas
import ____ as ____
# Flatten the tweets and store in `tweets`
tweets = ____(____)
# Create a DataFrame from `tweets`
ds_tweets = ____(____)
# Print out the first 5 tweets from this dataset
print(ds_tweets[____].values[0:5])