Пошук ключових слів
Підрахунок відомих ключових слів — один із перших способів проаналізувати текстові дані у наборі даних Twitter. У цьому наборі ви підрахуєте, скільки разів певні гештеґи з'являються в добірці твітів про data science. Для цього ви використаєте рядкові методи об'єкта Series у pandas.
pandas і numpy вже імпортовано як pd та np відповідно. Також для вас завантажено більш функціональну версію flatten_tweets і data_science_json.
Ця вправа є частиною курсу
Аналіз даних із соцмереж у Python
Інструкції до вправи
- Розгорніть твіти за допомогою
flatten_tweets()і збережіть їх уflat_tweets. - Перетворіть твіти на DataFrame за допомогою конструктора pandas DataFrame.
- Знайдіть згадки
#pythonу полі'text', ігноруючи регістр. - Виведіть частку твітів, що згадують
#python, підсумувавшиpythonза допомогоюnp.sum()і поділивши на загальну кількість твітів.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Flatten the tweets and store them
____ = ____(____)
# Convert to DataFrame
ds_tweets = ____.____(____)
# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)
# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)