LoslegenKostenlos starten

Dateien finden

Du bist mit der Bereinigung deines Tweet-Datensatzes noch nicht zufrieden. Es gibt immer noch zusätzliche Strings, die keine Stimmung ausdrücken. Darunter sind Strings, die auf Textdateinamen verweisen.

Du findest auch eine Möglichkeit, sie zu erkennen:

  • Sie stehen am Anfang des Strings.
  • Sie beginnen immer mit einer Folge aus 2 oder 3 Vokalen in Groß- oder Kleinschreibung (a e i o u).
  • Sie enden immer mit der Endung txt.

Du bist dir nicht sicher, ob du sie direkt entfernen sollst. Also schreibst du ein Skript, um sie zu finden und in einem separaten Datensatz zu speichern.

Du notierst dir ein paar Metazeichen zur Hilfe: ^ Anker an den Anfang, . beliebiges Zeichen.

Die Variable sentiment_analysis mit dem Text von zwei Tweets sowie das Modul re sind bereits in deiner Session geladen. Du kannst print() verwenden, um sie dir in der IPython-Konsole anzusehen.

Diese Übung ist Teil des Kurses

<Kurs>Reguläre Ausdrücke in Python</Kurs>
Kurs ansehen

Übungsanweisungen

  • Schreibe einen Regex, der dem Muster der Textdateinamen entspricht, z. B. aemyfile.txt.
  • Finde alle Treffer des Regex in den Elementen von sentiment_analysis. Gib das Ergebnis aus.
  • Ersetze alle Treffer des Regex durch einen leeren String "". Gib das Ergebnis aus.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
Code bearbeiten und ausführen