トークンパターンを指定する
この演習では、tweets データセットの text 列を扱います。課題は、CountVectorizer を使ってこのオブジェクト列をベクトル化することです。ベクトライザで異なるトークンパターンを適用します。トークンパターンを指定することで、特定の文字を除外できる点を思い出してください。
CountVectorizer はインポート済みです。
この演習はコースの一部です
Pythonで学ぶSentiment Analysis
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))