Matchen und Splitten
Einige der Tweets in deinem Datensatz wurden falsch heruntergeladen. Statt Leerzeichen zur Trennung von Wörtern enthalten sie seltsame Zeichen. Du entscheidest dich, reguläre Ausdrücke zu verwenden, um das zu beheben. Du gibst einige dieser Tweets aus, um zu verstehen, welches Muster du matchen musst.
Dir fällt auf, dass die Sätze immer durch ein Sonderzeichen, gefolgt von einer Zahl, dem Wort break und danach einem weiteren Sonderzeichen getrennt sind, z. B. &4break!. Die Wörter sind immer durch ein Sonderzeichen, das Wort new und ein normales zufälliges Zeichen getrennt, z. B. #newH.
Die Variable sentiment_analysis mit dem Text eines Tweets sowie das Modul re wurden bereits in deiner Session geladen. Du kannst print(sentiment_analysis) verwenden, um ihn dir in der IPython Shell anzusehen.
Diese Übung ist Teil des Kurses
<Kurs>Reguläre Ausdrücke in Python</Kurs>Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Write a regex to match pattern separating sentences
regex_sentence = ____"____"