始める無料で始める

別の名前で試してみましょう

Twitterの感情分析に引き続き取り組んでいます。今回は、気になった点をいくつか分析します。いくつかのツイートにメールアドレスが含まれていることに気づきました。そこで、最もよく登場する名前が何かを知りたくなりました。

メールアドレスの最初の部分を抽出したいとします。たとえば、メールが [email protected] の場合、関心があるのは marysmith90 のみです。 式全体にマッチさせる必要があります。そうすることで、メール内に存在する名前だけを抽出できます。また、対象は大文字(例: A、B、Z)や小文字(例: a、d、z)、そして数字を含む名前のみです。

3つのツイート本文を含むリスト sentiment_analysis と、re モジュールはすでにセッションに読み込まれています。IPython Shell で print() を使って内容を確認できます。

この演習はコースの一部です

Pythonで学ぶ正規表現

コースを見る

演習の手順

  • @ の前に現れる名前部分のみをキャプチャするように、メールにマッチする正規表現を完成させてください。
  • sentiment_analysis の各要素に対して、その正規表現のすべての一致を見つけます。結果を変数 email_matched に代入してください。
  • sentiment_analysis の各要素でキャプチャした結果を表示できるように、.format() メソッドを完成させてください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Write a regex that matches email
regex_email = r"___[____]____\S+"

for tweet in sentiment_analysis:
    # Find all matches of regex in each tweet
    email_matched = re.____(____, ____)

    # Complete the format method to print the results
    print("Lists of users found in this tweet: {}".format(____))
コードを編集して実行