Prova ett annat namn
Du fortsätter arbeta med din sentimentanalys av Twitter-data. Nu undersöker du något som väckt din nyfikenhet: du har märkt att vissa tweets innehåller e-postadresser och vill ta reda på vilket namn som förekommer mest.
Du vill extrahera den första delen av e-postadressen. Om e-postadressen till exempel är [email protected] är du bara intresserad av marysmith90.
Du behöver matcha hela uttrycket för att säkerställa att du bara extraherar namn som faktiskt finns i e-postadresser. Du är dessutom bara intresserad av namn som innehåller versaler (t.ex. A, B, Z), gemener (t.ex. a, d, z) och siffror.
Listan sentiment_analysis med texten från tre tweets samt modulen re har lästs in i din session. Du kan använda print() för att visa innehållet i IPython Shell.
Den här övningen är en del av kursen
Reguljära uttryck i Python
Övningsinstruktioner
- Komplettera regexet så att det matchar e-postadressen och bara fångar namnsdelen. Namnsdelen är det som kommer före
@. - Hitta alla matchningar av regexet i varje element i
sentiment_analysis. Tilldela resultatet till variabelnemail_matched. - Komplettera metoden
.format()för att skriva ut de resultat som fångats i varje element isentiment_analysis.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Write a regex that matches email
regex_email = r"___[____]____\S+"
for tweet in sentiment_analysis:
# Find all matches of regex in each tweet
email_matched = re.____(____, ____)
# Complete the format method to print the results
print("Lists of users found in this tweet: {}".format(____))