Tutto pulito
Torniamo al tuo progetto di sentiment analysis su Twitter! Ci sono vari tipi di stringhe che complicano l’analisi, ma non aggiungono alcuna informazione utile sul sentiment. Tra queste, ci sono i link e le menzioni degli utenti.
Per ripulire i tweet, vuoi prima estrarne alcuni esempi. Sai che nella maggior parte dei casi i link iniziano con http e non contengono spazi, ad esempio https://www.datacamp.com. Le menzioni degli utenti iniziano con @ e possono contenere solo lettere e numeri, ad esempio @johnsmith3.
Prendi nota di alcuni quantificatori utili: * zero o più volte, + una o più volte, ? zero o una volta.
La lista sentiment_analysis con il testo di tre tweet è già caricata nella tua sessione. Puoi usare print() per visualizzare i dati nell’IPython Shell.
Questo esercizio fa parte del corso
Espressioni regolari in Python
Istruzioni dell'esercizio
- Importa il modulo
re. - Scrivi una regex per trovare tutte le occorrenze di link che iniziano con
httpin ognitweetinsentiment_analysis. Stampa il risultato. - Scrivi una regex per trovare tutte le occorrenze di menzioni utente in ogni
tweetinsentiment_analysis. Stampa il risultato.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))