Kom igångKom igång gratis

Prova ett annat namn

Du fortsätter arbeta med din sentimentanalys av Twitter-data. Nu undersöker du något som väckt din nyfikenhet: du har märkt att vissa tweets innehåller e-postadresser och vill ta reda på vilket namn som förekommer mest.

Du vill extrahera den första delen av e-postadressen. Om e-postadressen till exempel är [email protected] är du bara intresserad av marysmith90.
Du behöver matcha hela uttrycket för att säkerställa att du bara extraherar namn som faktiskt finns i e-postadresser. Du är dessutom bara intresserad av namn som innehåller versaler (t.ex. A, B, Z), gemener (t.ex. a, d, z) och siffror.

Listan sentiment_analysis med texten från tre tweets samt modulen re har lästs in i din session. Du kan använda print() för att visa innehållet i IPython Shell.

Den här övningen är en del av kursen

Reguljära uttryck i Python

Visa kurs

Övningsinstruktioner

  • Komplettera regexet så att det matchar e-postadressen och bara fångar namnsdelen. Namnsdelen är det som kommer före @.
  • Hitta alla matchningar av regexet i varje element i sentiment_analysis. Tilldela resultatet till variabeln email_matched.
  • Komplettera metoden .format() för att skriva ut de resultat som fångats i varje element i sentiment_analysis.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Write a regex that matches email
regex_email = r"___[____]____\S+"

for tweet in sentiment_analysis:
    # Find all matches of regex in each tweet
    email_matched = re.____(____, ____)

    # Complete the format method to print the results
    print("Lists of users found in this tweet: {}".format(____))
Redigera och kör kod