Поиск ключевых слов
Подсчёт известных ключевых слов — один из первых способов анализа текстовых данных в наборе твитов. В этом упражнении вы будете считать, сколько раз определённые хэштеги встречаются в коллекции твитов о data science. Для этого вы воспользуетесь строковыми методами объекта pandas Series.
pandas и numpy уже импортированы как pd и np соответственно. Расширенная версия функции flatten_tweets и объект data_science_json также загружены заранее.
Это упражнение является частью курса
Анализ данных социальных сетей на Python
Инструкции к упражнению
- Выровняйте твиты с помощью
flatten_tweets()и сохраните результат вflat_tweets. - Преобразуйте твиты в DataFrame, используя конструктор DataFrame из pandas.
- Найдите упоминания
#pythonв столбце'text', игнорируя регистр. - Выведите долю твитов с упоминанием
#python: просуммируйте значенияpythonс помощьюnp.sum()и разделите на общее количество твитов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Flatten the tweets and store them
____ = ____(____)
# Convert to DataFrame
ds_tweets = ____.____(____)
# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)
# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)