別の名前で試してみましょう
Twitterの感情分析に引き続き取り組んでいます。今回は、気になった点をいくつか分析します。いくつかのツイートにメールアドレスが含まれていることに気づきました。そこで、最もよく登場する名前が何かを知りたくなりました。
メールアドレスの最初の部分を抽出したいとします。たとえば、メールが [email protected] の場合、関心があるのは marysmith90 のみです。
式全体にマッチさせる必要があります。そうすることで、メール内に存在する名前だけを抽出できます。また、対象は大文字(例: A、B、Z)や小文字(例: a、d、z)、そして数字を含む名前のみです。
3つのツイート本文を含むリスト sentiment_analysis と、re モジュールはすでにセッションに読み込まれています。IPython Shell で print() を使って内容を確認できます。
この演習はコースの一部です
Pythonで学ぶ正規表現
演習の手順
@の前に現れる名前部分のみをキャプチャするように、メールにマッチする正規表現を完成させてください。sentiment_analysisの各要素に対して、その正規表現のすべての一致を見つけます。結果を変数email_matchedに代入してください。sentiment_analysisの各要素でキャプチャした結果を表示できるように、.format()メソッドを完成させてください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Write a regex that matches email
regex_email = r"___[____]____\S+"
for tweet in sentiment_analysis:
# Find all matches of regex in each tweet
email_matched = re.____(____, ____)
# Complete the format method to print the results
print("Lists of users found in this tweet: {}".format(____))