Aan de slagBegin gratis

Probeer een andere naam

Je werkt nog steeds aan je Twitter-sentimentanalyse. Je bekijkt nu een paar dingen die je opvielen. Je merkte dat er e-mailadressen in sommige tweets staan. Nu ben je benieuwd wat de meest voorkomende naam is.

Je wilt het eerste deel van het e-mailadres extraheren. Bijv. als je het adres [email protected] hebt, ben je alleen geïnteresseerd in marysmith90. Je moet de hele expressie matchen, zodat je zeker weet dat je alleen namen uit e-mails extraheert. Ook ben je alleen geïnteresseerd in namen met hoofd- (bijv. A, B, Z) of kleine letters (bijv. a, d, z) en cijfers.

De lijst sentiment_analysis met de tekst van drie tweets en de module re zijn al in je sessie geladen. Je kunt print() gebruiken om ze in de IPython Shell te bekijken.

Deze oefening maakt deel uit van de cursus

Regular expressions in Python

Bekijk cursus

Oefeninstructies

  • Vul de regex aan om het e-mailadres te matchen waarbij je alleen het naamgedeelte vastlegt. Het naamgedeelte staat vóór de @.
  • Zoek alle matches van de regex in elk element van sentiment_analysis. Ken dit toe aan de variabele email_matched.
  • Maak de .format()-methode af om de resultaten af te drukken die in elk element van sentiment_analysis zijn vastgelegd.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Write a regex that matches email
regex_email = r"___[____]____\S+"

for tweet in sentiment_analysis:
    # Find all matches of regex in each tweet
    email_matched = re.____(____, ____)

    # Complete the format method to print the results
    print("Lists of users found in this tweet: {}".format(____))
Code bewerken en uitvoeren