Matchen en splitsen
Een paar tweets in je gegevensset zijn niet goed gedownload. In plaats van spaties tussen woorden staan er vreemde tekens. Je besluit reguliere expressies te gebruiken om dit op te lossen. Je print een paar van deze tweets om te snappen welk patroon je moet matchen.
Je merkt dat de zinnen altijd gescheiden zijn door een speciaal teken, gevolgd door een getal, het woord break, en daarna nog een speciaal teken, bijvoorbeeld &4break!. De woorden zijn altijd gescheiden door een speciaal teken, het woord new, en een normaal willekeurig teken, bijvoorbeeld #newH.
De variabele sentiment_analysis met de tekst van één tweet en de module re zijn al in je sessie geladen. Je kunt print(sentiment_analysis) gebruiken om het in de IPython-shell te bekijken.
Deze oefening maakt deel uit van de cursus
Regular expressions in Python
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Write a regex to match pattern separating sentences
regex_sentence = ____"____"