LoslegenKostenlos starten

Alles sauber

Zurück zu deinem Twitter-Sentiment-Analyse-Projekt! Es gibt mehrere Arten von Strings, die die Komplexität deiner Sentiment-Analyse erhöhen. Diese Strings liefern jedoch keine nützlichen Stimmungen. Dazu gehören unter anderem Links und Nutzererwähnungen.

Um die Tweets zu bereinigen, möchtest du zuerst ein paar Beispiele herausziehen. Du weißt, dass Links meistens mit http beginnen und keine Leerzeichen enthalten, z. B. https://www.datacamp.com. Nutzererwähnungen beginnen mit @ und können nur Buchstaben und Zahlen enthalten, z. B. @johnsmith3.

Du notierst dir ein paar hilfreiche Quantoren: * null- oder mehrmals, + einmal oder mehr, ? null- oder einmal.

Die Liste sentiment_analysis mit den Texten von drei Tweets ist bereits in deiner Session geladen. Du kannst print() verwenden, um die Daten in der IPython-Shell anzusehen.

Diese Übung ist Teil des Kurses

<Kurs>Reguläre Ausdrücke in Python</Kurs>
Kurs ansehen

Übungsanweisungen

  • Importiere das Modul re.
  • Schreibe einen Regex, um alle Vorkommen von http-Links in jedem tweet in sentiment_analysis zu finden. Gib das Ergebnis aus.
  • Schreibe einen Regex, um alle Vorkommen von Nutzererwähnungen in jedem tweet in sentiment_analysis zu finden. Gib das Ergebnis aus.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Code bearbeiten und ausführen