Inizia subitoInizia gratis

Capire la differenza

Devi continuare a lavorare e ripulire il tuo insieme di dati di tweet. Ti accorgi che sono presenti alcuni tag HTML. Devi rimuoverli ma mantenere il contenuto interno, perché è utile per l'analisi.

Diamo un'occhiata a questa frase che contiene un tag HTML:

I want to see that <strong>amazing show</strong> again!.

Sai che per prendere il tag HTML devi fare il match di qualsiasi cosa racchiusa tra le parentesi angolari < >. Ma il problema principale è che il tag di chiusura ha la stessa struttura. Se fai il match di troppo, finirai per rimuovere informazioni chiave. Quindi devi decidere se usare un quantificatore "avido" o "pigro".

La stringa è già caricata come string nella tua sessione.

Questo esercizio fa parte del corso

Espressioni regolari in Python

Visualizza corso

Istruzioni dell'esercizio

  • Importa il modulo re.
  • Scrivi un'espressione regex per sostituire i tag HTML con una stringa vuota.
  • Stampa il risultato.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
Modifica ed esegui il codice