Задайте шаблон токенів
У цій вправі ви працюватимете зі стовпцем text набору даних tweets. Ваше завдання — векторизувати стовпець-об'єкт за допомогою CountVectorizer. Ви застосуєте різні шаблони токенів у векторизаторі. Пам'ятайте: задаючи шаблон токенів, ви можете відфільтровувати символи.
CountVectorizer уже імпортовано для вас.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))