Trovare file
Non sei soddisfatto della pulizia del tuo insieme di dati di tweet. Ci sono ancora stringhe extra che non forniscono alcun sentimento. Tra queste ci sono stringhe che si riferiscono a nomi di file di testo.
Hai anche trovato un modo per rilevarle:
- Compaiono all’inizio della stringa.
- Iniziano sempre con una sequenza di 2 o 3 vocali, maiuscole o minuscole (a e i o u).
- Terminano sempre con il suffisso
txt.
Non sei sicuro se rimuoverle direttamente. Quindi scrivi uno script per trovarle e salvarle in un insieme di dati separato.
Annoti alcuni metacaratteri che ti aiutano: ^ àncora all’inizio, . qualsiasi carattere.
La variabile sentiment_analysis che contiene il testo di due tweet e il modulo re sono già caricati nella tua sessione. Puoi usare print() per visualizzarli nella IPython Shell.
Questo esercizio fa parte del corso
Espressioni regolari in Python
Istruzioni dell'esercizio
- Scrivi una regex che corrisponda al modello dei nomi dei file di testo, ad esempio
aemyfile.txt. - Trova tutte le corrispondenze della regex negli elementi di
sentiment_analysis. Stampa il risultato. - Sostituisci tutte le corrispondenze della regex con una stringa vuota
"". Stampa il risultato.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))