НачатьНачать бесплатно

Поиск ключевых слов

Подсчёт известных ключевых слов — один из первых способов анализа текстовых данных в наборе твитов. В этом упражнении вы будете считать, сколько раз определённые хэштеги встречаются в коллекции твитов о data science. Для этого вы воспользуетесь строковыми методами объекта pandas Series.

pandas и numpy уже импортированы как pd и np соответственно. Расширенная версия функции flatten_tweets и объект data_science_json также загружены заранее.

Это упражнение является частью курса

Анализ данных социальных сетей на Python

Посмотреть курс

Инструкции к упражнению

  • Выровняйте твиты с помощью flatten_tweets() и сохраните результат в flat_tweets.
  • Преобразуйте твиты в DataFrame, используя конструктор DataFrame из pandas.
  • Найдите упоминания #python в столбце 'text', игнорируя регистр.
  • Выведите долю твитов с упоминанием #python: просуммируйте значения python с помощью np.sum() и разделите на общее количество твитов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Flatten the tweets and store them
____ = ____(____)

# Convert to DataFrame
ds_tweets = ____.____(____)

# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)

# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)
Редактировать и запускать код