Tokens ophalen
Je volgende stap is het tokenizen van de tekst van je tweets. Tokenization is het proces waarbij je een string opsplitst in lexicale eenheden of, eenvoudiger gezegd, woorden. Maar eerst moet je hashtags verwijderen zodat ze je proces niet vertroebelen. Je ziet dat hashtags beginnen met een #-symbool en letters en cijfers bevatten, maar nooit spaties. Daarna wil je de tekst splitsen op witruimtes om de tokens te krijgen.
Je hebt je lijst met kwantoren bij de hand: * nul of meer keer, + één of meer keer, ? nul of één keer, {n, m} minimaal n, maximaal m.
De variabele sentiment_analysis met de tekst van één tweet en de module re zijn al geladen in je sessie. Je kunt print(sentiment_analysis) gebruiken om deze te bekijken in de IPython Shell.
Deze oefening maakt deel uit van de cursus
Regular expressions in Python
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Write a regex matching the hashtag pattern
regex = r"____"