すべてをクリーンに
Twitter の感情分析プロジェクトに戻りましょう。感情分析をややこしくする文字列がいくつかありますが、これらは有用な感情情報を提供しません。たとえばリンクやユーザーのメンションです。
ツイートをクリーンアップするために、まずはいくつかの例を抽出したいとします。多くの場合、リンクは http で始まり、空白文字を含まないことが分かっています(例: https://www.datacamp.com)。ユーザーのメンションは @ で始まり、英字と数字のみを含みます(例: @johnsmith3)。
役に立つ量指定子もメモしておきます。* は0回以上、+ は1回以上、? は0回または1回です。
3つのツイート本文を含むリスト sentiment_analysis は、すでにセッションに読み込まれています。IPython Shell でデータを確認するには、print() を使ってください。
この演習はコースの一部です
Pythonで学ぶ正規表現
演習の手順
reモジュールをインポートします。sentiment_analysisの各tweetに現れるhttpリンクのすべての一致を見つける正規表現を書き、結果を出力します。sentiment_analysisの各tweetに現れるユーザーのメンションのすべての一致を見つける正規表現を書き、結果を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))