Завантаження твітів у DataFrame
Тепер час імпортувати дані в датафрейм pandas, щоб аналізувати твіти у великому масштабі.
Ми працюватимемо з набором твітів, що містять гештег '#rstats' або '#python'. Цей набір даних збережено як список JSON-об'єктів твіту в data_science_json.
У цьому курсі є багато понять, які ви могли забути, тож якщо потрібне швидке нагадування, завантажте шпаргалку з основ pandas і тримайте її під рукою!
Зважайте, що це реальні дані з Twitter, тож завжди існує ризик наявності нецензурної лексики чи іншого образливого контенту (в цій вправі та в усіх наступних вправах, де також використовуються реальні дані з Twitter).
Ця вправа є частиною курсу
Аналіз даних із соцмереж у Python
Інструкції до вправи
- Імпортуйте
pandas(пам'ятайте: зазвичай його позначають псевдонімомpd). - „Сплющте" твіти з
data_science_jsonза допомогоюflatten_tweets()і збережіть їх уtweets. - Створіть DataFrame з
tweetsза допомогоюpd.DataFrame(). - Виведіть текст перших 5 твітів.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import pandas
import ____ as ____
# Flatten the tweets and store in `tweets`
tweets = ____(____)
# Create a DataFrame from `tweets`
ds_tweets = ____(____)
# Print out the first 5 tweets from this dataset
print(ds_tweets[____].values[0:5])