Capire la differenza
Devi continuare a lavorare e ripulire il tuo insieme di dati di tweet. Ti accorgi che sono presenti alcuni tag HTML. Devi rimuoverli ma mantenere il contenuto interno, perché è utile per l'analisi.
Diamo un'occhiata a questa frase che contiene un tag HTML:
I want to see that <strong>amazing show</strong> again!.
Sai che per prendere il tag HTML devi fare il match di qualsiasi cosa racchiusa tra le parentesi angolari < >. Ma il problema principale è che il tag di chiusura ha la stessa struttura. Se fai il match di troppo, finirai per rimuovere informazioni chiave. Quindi devi decidere se usare un quantificatore "avido" o "pigro".
La stringa è già caricata come string nella tua sessione.
Questo esercizio fa parte del corso
Espressioni regolari in Python
Istruzioni dell'esercizio
- Importa il modulo
re. - Scrivi un'espressione
regexper sostituire i tag HTML con una stringa vuota. - Stampa il risultato.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____