Tokens erzeugen
Als Nächstes sollst du den Text deiner Tweets tokenisieren. Tokenisierung bedeutet, einen String in lexikalische Einheiten zu zerlegen – einfacher gesagt: in Wörter. Zuerst musst du jedoch Hashtags entfernen, damit sie den Prozess nicht verfälschen. Dir ist aufgefallen, dass Hashtags mit dem Symbol # beginnen und Buchstaben und Zahlen enthalten, aber niemals Leerzeichen. Danach willst du den Text an Übereinstimmungen von Leerraum aufteilen, um die Tokens zu erhalten.
Du hast deine Liste mit Quantifizierern zur Hand: * null- oder mehrmals, + einmal oder mehrmals, ? null- oder einmal, {n, m} Minimum n, Maximum m.
Die Variable sentiment_analysis mit dem Text eines Tweets sowie das Modul re sind bereits in deiner Session geladen. Mit print(sentiment_analysis) kannst du sie dir in der IPython Shell anzeigen lassen.
Diese Übung ist Teil des Kurses
<Kurs>Reguläre Ausdrücke in Python</Kurs>Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Write a regex matching the hashtag pattern
regex = r"____"