指定 token 模式
在本练习中,您将使用 tweets 数据集的 text 列。您的任务是使用 CountVectorizer 对该对象列进行向量化。您将为向量器应用不同的 token 模式。请记住,通过指定 token 模式,您可以过滤掉某些字符。
CountVectorizer 已为您导入。
本练习是课程的一部分
Python 中的情感分析
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))