НачатьНачать бесплатно

Загрузка твитов в DataFrame

Пришло время загрузить данные в pandas DataFrame, чтобы анализировать твиты в больших объёмах.

Мы будем работать с набором данных, содержащим твиты с хэштегами '#rstats' или '#python'. Этот набор хранится в виде списка JSON-объектов твитов в переменной data_science_json.

Курс затрагивает множество концепций, которые легко забыть — поэтому при необходимости скачайте шпаргалку по основам pandas и держите её под рукой!

Обратите внимание: это реальные данные из Twitter, поэтому в них могут встречаться нецензурные выражения или иной нежелательный контент (в этом упражнении и во всех последующих, где также используются реальные данные Twitter).

Это упражнение является частью курса

Анализ данных социальных сетей на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте pandas (по договорённости будем использовать псевдоним pd).
  • Обработайте твиты из data_science_json с помощью функции flatten_tweets() и сохраните результат в переменную tweets.
  • Создайте DataFrame из tweets с помощью pd.DataFrame().
  • Выведите текст первых 5 твитов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import pandas
import ____ as ____

# Flatten the tweets and store in `tweets`
tweets = ____(____)

# Create a DataFrame from `tweets`
ds_tweets = ____(____)

# Print out the first 5 tweets from this dataset
print(ds_tweets[____].values[0:5])
Редактировать и запускать код