开始使用免费开始使用

指定 token 模式

在本练习中,您将使用 tweets 数据集的 text 列。您的任务是使用 CountVectorizer 对该对象列进行向量化。您将为向量器应用不同的 token 模式。请记住,通过指定 token 模式,您可以过滤掉某些字符。

CountVectorizer 已为您导入。

本练习是课程的一部分

Python 中的情感分析

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))
编辑并运行代码