始める無料で始める

トークンパターンを指定する

この演習では、tweets データセットの text 列を扱います。課題は、CountVectorizer を使ってこのオブジェクト列をベクトル化することです。ベクトライザで異なるトークンパターンを適用します。トークンパターンを指定することで、特定の文字を除外できる点を思い出してください。

CountVectorizer はインポート済みです。

この演習はコースの一部です

Pythonで学ぶSentiment Analysis

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Build and fit the vectorizer
vect = ____(____=r'\b[^\d\W][^\d\W]+\b').fit(tweets.text)
vect.transform(tweets.text)
print('Length of vectorizer: ', len(vect.get_feature_names()))
コードを編集して実行