Aan de slagBegin gratis

Alles schoon

Terug naar je Twitter-sentimentanalyseproject! Er zijn verschillende soorten strings die de complexiteit van je sentimentanalyse verhogen. Maar deze strings leveren geen nuttig sentiment op. Denk bijvoorbeeld aan links en gebruikersvermeldingen.

Om de tweets op te schonen, wil je eerst wat voorbeelden eruit halen. Je weet dat links meestal beginnen met http en geen witruimte bevatten, bijv. https://www.datacamp.com. Gebruikersvermeldingen beginnen met @ en kunnen alleen letters en cijfers hebben, bijv. @johnsmith3.

Je noteert een paar handige kwantoren om je te helpen: * nul of meer keer, + één of meer keer, ? nul of één keer.

De lijst sentiment_analysis met de tekst van drie tweets is al in je sessie geladen. Je kunt print() gebruiken om de gegevens in de IPython Shell te bekijken.

Deze oefening maakt deel uit van de cursus

Regular expressions in Python

Bekijk cursus

Oefeninstructies

  • Importeer de module re.
  • Schrijf een regex om alle matches te vinden van http-links die in elke tweet in sentiment_analysis voorkomen. Print het resultaat.
  • Schrijf een regex om alle matches te vinden van gebruikersvermeldingen die in elke tweet in sentiment_analysis voorkomen. Print het resultaat.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Code bewerken en uitvoeren