Хэштеги и упоминания в российских твитах
Вернёмся к датафрейму tweets с российскими твитами. В этом упражнении вы вычислите количество хэштегов и упоминаний в каждом твите: для этого определите две функции — count_hashtags() и count_mentions() — и примените их к признаку content датафрейма tweets.
Напомним, что твиты хранятся в признаке content датафрейма tweets.
Это упражнение является частью курса
Конструирование признаков для NLP на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Function that returns numner of hashtags in a string
def count_hashtags(string):
# Split the string into words
words = string.split()
# Create a list of words that are hashtags
hashtags = [word for word in words if ____.____(____)]
# Return number of hashtags
return(len(hashtags))
# Create a feature hashtag_count and display distribution
tweets['hashtag_count'] = tweets['content'].apply(count_hashtags)
tweets['hashtag_count'].hist()
plt.title('Hashtag count distribution')
plt.show()