Kom igångKom igång gratis

Hämta tokens

Nästa steg är att tokenisera texten i dina tweets. Tokenisering innebär att man delar upp en sträng i lexikala enheter – med andra ord ord. Men först behöver du ta bort hashtags så att de inte stör processen. Du noterar att hashtags börjar med symbolen # och innehåller bokstäver och siffror, men aldrig blanksteg. Därefter planerar du att dela upp texten vid blanksteg för att få fram tokens.

Du tar fram din lista med kvantifierare: * noll eller fler gånger, + en eller fler gånger, ? noll eller en gång, {n, m} minst n, högst m.

Variabeln sentiment_analysis med texten från en tweet samt modulen re är redan laddade i din session. Du kan använda print(sentiment_analysis) för att visa den i IPython Shell.

Den här övningen är en del av kursen

Reguljära uttryck i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Write a regex matching the hashtag pattern
regex = r"____"
Redigera och kör kod