Probeer een andere naam
Je werkt nog steeds aan je Twitter-sentimentanalyse. Je bekijkt nu een paar dingen die je opvielen. Je merkte dat er e-mailadressen in sommige tweets staan. Nu ben je benieuwd wat de meest voorkomende naam is.
Je wilt het eerste deel van het e-mailadres extraheren. Bijv. als je het adres [email protected] hebt, ben je alleen geïnteresseerd in marysmith90.
Je moet de hele expressie matchen, zodat je zeker weet dat je alleen namen uit e-mails extraheert. Ook ben je alleen geïnteresseerd in namen met hoofd- (bijv. A, B, Z) of kleine letters (bijv. a, d, z) en cijfers.
De lijst sentiment_analysis met de tekst van drie tweets en de module re zijn al in je sessie geladen. Je kunt print() gebruiken om ze in de IPython Shell te bekijken.
Deze oefening maakt deel uit van de cursus
Regular expressions in Python
Oefeninstructies
- Vul de regex aan om het e-mailadres te matchen waarbij je alleen het naamgedeelte vastlegt. Het naamgedeelte staat vóór de
@. - Zoek alle matches van de regex in elk element van
sentiment_analysis. Ken dit toe aan de variabeleemail_matched. - Maak de
.format()-methode af om de resultaten af te drukken die in elk element vansentiment_analysiszijn vastgelegd.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Write a regex that matches email
regex_email = r"___[____]____\S+"
for tweet in sentiment_analysis:
# Find all matches of regex in each tweet
email_matched = re.____(____, ____)
# Complete the format method to print the results
print("Lists of users found in this tweet: {}".format(____))