始める無料で始める

トークンの取得

次のステップは、ツイートのテキストをトークン化することです。トークン化とは、文字列を語彙単位、つまり簡単に言えば「単語」に分割することを指します。その前に、処理を邪魔しないようにハッシュタグを取り除く必要があります。ハッシュタグは # 記号で始まり、英数字を含みますが、空白は含まれないとわかっています。その後、空白にマッチする箇所でテキストを分割して、トークンを得る予定です。

参考のために量指定子の一覧を用意しました:* 0回以上、+ 1回以上、? 0回または1回、{n, m} 最小n回、最大m回。

1件のツイートのテキストを含む変数 sentiment_analysis と、re モジュールはすでにセッションに読み込まれています。IPython Shell で print(sentiment_analysis) を使うと内容を確認できます。

この演習はコースの一部です

Pythonで学ぶ正規表現

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Write a regex matching the hashtag pattern
regex = r"____"
コードを編集して実行