Încărcarea tweet-urilor într-un DataFrame
E momentul să importăm date într-un DataFrame pandas pentru a analiza tweet-uri la scară largă.
Vom lucra cu un set de date de tweet-uri care conțin hashtag-ul '#rstats' sau '#python'. Acest set de date este stocat ca o listă de obiecte JSON de tweet-uri în data_science_json.
Acest curs atinge multe concepte pe care poate le-ai uitat, așa că dacă ai nevoie de o recapitulare rapidă, descarcă Cheat Sheet-ul de bază pentru pandas și ține-l la îndemână!
Reține că acestea sunt date reale de pe Twitter, prin urmare există întotdeauna riscul prezenței unor cuvinte vulgare sau a altor conținuturi ofensatoare (în acest exercițiu și în orice exercițiu următor care folosește tot date reale de pe Twitter).
Acest exercițiu face parte din cursul
Analiza datelor din social media în Python
Instrucțiuni pentru exercițiu
- Importă
pandas(prin convenție, îi vom da aliasulpd). - Aplatizează tweet-urile din
data_science_jsoncuflatten_tweets()și stochează rezultatul întweets. - Creează un DataFrame din
tweetsfolosindpd.DataFrame(). - Afișează textul primelor 5 tweet-uri.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import pandas
import ____ as ____
# Flatten the tweets and store in `tweets`
tweets = ____(____)
# Create a DataFrame from `tweets`
ds_tweets = ____(____)
# Print out the first 5 tweets from this dataset
print(ds_tweets[____].values[0:5])