Rensat och klart
Dags att återgå till ditt sentimentanalys-projekt på Twitter! Det finns flera typer av strängar som ökar komplexiteten i analysen – men som inte bidrar med något användbart sentiment. Bland dessa hittar du länkar och användaromnämnanden.
För att rensa tweetsarna vill du börja med att plocka ut några exempel. Du vet att länkar oftast börjar med http och inte innehåller några blanksteg, t.ex. https://www.datacamp.com. Användaromnämnanden börjar med @ och får bara innehålla bokstäver och siffror, t.ex. @johnsmith3.
Du noterar några användbara kvantifierare: * noll eller fler gånger, + en eller fler gånger, ? noll eller en gång.
Listan sentiment_analysis med texten från tre tweets är redan inläst i din session. Du kan använda print() för att visa datan i IPython Shell.
Den här övningen är en del av kursen
Reguljära uttryck i Python
Övningsinstruktioner
- Importera modulen
re. - Skriv ett reguljärt uttryck för att hitta alla förekomster av
http-länkar i varjetweetisentiment_analysis. Skriv ut resultatet. - Skriv ett reguljärt uttryck för att hitta alla förekomster av användaromnämnanden i varje
tweetisentiment_analysis. Skriv ut resultatet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))