НачатьНачать бесплатно

Хэштеги и упоминания в российских твитах

Вернёмся к датафрейму tweets с российскими твитами. В этом упражнении вы вычислите количество хэштегов и упоминаний в каждом твите: для этого определите две функции — count_hashtags() и count_mentions() — и примените их к признаку content датафрейма tweets.

Напомним, что твиты хранятся в признаке content датафрейма tweets.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Function that returns numner of hashtags in a string
def count_hashtags(string):
	# Split the string into words
    words = string.split()
    
    # Create a list of words that are hashtags
    hashtags = [word for word in words if ____.____(____)]
    
    # Return number of hashtags
    return(len(hashtags))

# Create a feature hashtag_count and display distribution
tweets['hashtag_count'] = tweets['content'].apply(count_hashtags)
tweets['hashtag_count'].hist()
plt.title('Hashtag count distribution')
plt.show()
Редактировать и запускать код