Kom igångKom igång gratis

Rensat och klart

Dags att återgå till ditt sentimentanalys-projekt på Twitter! Det finns flera typer av strängar som ökar komplexiteten i analysen – men som inte bidrar med något användbart sentiment. Bland dessa hittar du länkar och användaromnämnanden.

För att rensa tweetsarna vill du börja med att plocka ut några exempel. Du vet att länkar oftast börjar med http och inte innehåller några blanksteg, t.ex. https://www.datacamp.com. Användaromnämnanden börjar med @ och får bara innehålla bokstäver och siffror, t.ex. @johnsmith3.

Du noterar några användbara kvantifierare: * noll eller fler gånger, + en eller fler gånger, ? noll eller en gång.

Listan sentiment_analysis med texten från tre tweets är redan inläst i din session. Du kan använda print() för att visa datan i IPython Shell.

Den här övningen är en del av kursen

Reguljära uttryck i Python

Visa kurs

Övningsinstruktioner

  • Importera modulen re.
  • Skriv ett reguljärt uttryck för att hitta alla förekomster av http-länkar i varje tweet i sentiment_analysis. Skriv ut resultatet.
  • Skriv ett reguljärt uttryck för att hitta alla förekomster av användaromnämnanden i varje tweet i sentiment_analysis. Skriv ut resultatet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Redigera och kör kod