Загрузка твитов в DataFrame
Пришло время загрузить данные в pandas DataFrame, чтобы анализировать твиты в больших объёмах.
Мы будем работать с набором данных, содержащим твиты с хэштегами '#rstats' или '#python'. Этот набор хранится в виде списка JSON-объектов твитов в переменной data_science_json.
Курс затрагивает множество концепций, которые легко забыть — поэтому при необходимости скачайте шпаргалку по основам pandas и держите её под рукой!
Обратите внимание: это реальные данные из Twitter, поэтому в них могут встречаться нецензурные выражения или иной нежелательный контент (в этом упражнении и во всех последующих, где также используются реальные данные Twitter).
Это упражнение является частью курса
Анализ данных социальных сетей на Python
Инструкции к упражнению
- Импортируйте
pandas(по договорённости будем использовать псевдонимpd). - Обработайте твиты из
data_science_jsonс помощью функцииflatten_tweets()и сохраните результат в переменнуюtweets. - Создайте DataFrame из
tweetsс помощьюpd.DataFrame(). - Выведите текст первых 5 твитов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import pandas
import ____ as ____
# Flatten the tweets and store in `tweets`
tweets = ____(____)
# Create a DataFrame from `tweets`
ds_tweets = ____(____)
# Print out the first 5 tweets from this dataset
print(ds_tweets[____].values[0:5])