Den Unterschied verstehen
Du musst weiter an deinem Tweets-Datensatz arbeiten und ihn bereinigen. Dabei stellst du fest, dass einige HTML-Tags vorhanden sind. Du musst diese entfernen, aber den Inhalt dazwischen beibehalten, weil er für die Analyse nützlich ist.
Schauen wir uns diesen Satz mit einem HTML-Tag an:
I want to see that <strong>amazing show</strong> again!.
Du weißt, dass du für das HTML-Tag alles abgleichen musst, was in spitzen Klammern < > steht. Das größte Problem ist jedoch, dass der schließende Tag die gleiche Struktur hat. Wenn du zu viel matchst, entfernst du am Ende wichtige Informationen. Also musst du entscheiden, ob du einen gierigen oder einen faulen Quantor verwendest.
Der String ist bereits als string in deiner Session geladen.
Diese Übung ist Teil des Kurses
<Kurs>Reguläre Ausdrücke in Python</Kurs>Übungsanweisungen
- Importiere das Modul
re. - Schreibe einen
regex-Ausdruck, um HTML-Tags durch einen leeren String zu ersetzen. - Gib das Ergebnis aus.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____