Hämta tokens
Nästa steg är att tokenisera texten i dina tweets. Tokenisering innebär att man delar upp en sträng i lexikala enheter – med andra ord ord. Men först behöver du ta bort hashtags så att de inte stör processen. Du noterar att hashtags börjar med symbolen # och innehåller bokstäver och siffror, men aldrig blanksteg. Därefter planerar du att dela upp texten vid blanksteg för att få fram tokens.
Du tar fram din lista med kvantifierare: * noll eller fler gånger, + en eller fler gånger, ? noll eller en gång, {n, m} minst n, högst m.
Variabeln sentiment_analysis med texten från en tweet samt modulen re är redan laddade i din session. Du kan använda print(sentiment_analysis) för att visa den i IPython Shell.
Den här övningen är en del av kursen
Reguljära uttryck i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Write a regex matching the hashtag pattern
regex = r"____"