Ottenere i token
Il prossimo passo è tokenizzare il testo dei tuoi tweet. La tokenizzazione è il processo di suddividere una stringa in unità lessicali o, in parole semplici, in parole. Prima però, devi rimuovere gli hashtag così da non interferire con il processo. Ti accorgi che gli hashtag iniziano con il simbolo # e contengono lettere e numeri, ma mai spazi. Dopo di ciò, hai in programma di dividere il testo in corrispondenza degli spazi per ottenere i token.
Hai a disposizione l’elenco dei quantificatori che ti può aiutare: * zero o più volte, + una o più volte, ? zero o una volta, {n, m} minimo n, massimo m.
La variabile sentiment_analysis che contiene il testo di un tweet e il modulo re sono già caricati nella tua sessione. Puoi usare print(sentiment_analysis) per visualizzarlo nella IPython Shell.
Questo esercizio fa parte del corso
Espressioni regolari in Python
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Write a regex matching the hashtag pattern
regex = r"____"