Inizia subitoInizia gratis

Tutto pulito

Torniamo al tuo progetto di sentiment analysis su Twitter! Ci sono vari tipi di stringhe che complicano l’analisi, ma non aggiungono alcuna informazione utile sul sentiment. Tra queste, ci sono i link e le menzioni degli utenti.

Per ripulire i tweet, vuoi prima estrarne alcuni esempi. Sai che nella maggior parte dei casi i link iniziano con http e non contengono spazi, ad esempio https://www.datacamp.com. Le menzioni degli utenti iniziano con @ e possono contenere solo lettere e numeri, ad esempio @johnsmith3.

Prendi nota di alcuni quantificatori utili: * zero o più volte, + una o più volte, ? zero o una volta.

La lista sentiment_analysis con il testo di tre tweet è già caricata nella tua sessione. Puoi usare print() per visualizzare i dati nell’IPython Shell.

Questo esercizio fa parte del corso

Espressioni regolari in Python

Visualizza corso

Istruzioni dell'esercizio

  • Importa il modulo re.
  • Scrivi una regex per trovare tutte le occorrenze di link che iniziano con http in ogni tweet in sentiment_analysis. Stampa il risultato.
  • Scrivi una regex per trovare tutte le occorrenze di menzioni utente in ogni tweet in sentiment_analysis. Stampa il risultato.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Modifica ed esegui il codice