Kom igångKom igång gratis

Hitta filer

Du är inte nöjd med rensningen av din tweets-datamängd. Det finns fortfarande extra strängar som inte tillför någon sentimentinformation. Bland dessa finns strängar som refererar till textfilnamn.

Du hittar ett sätt att identifiera dem:

  • De förekommer i början av strängen.
  • De börjar alltid med en sekvens av 2 eller 3 vokaler (a e i o u) i stora eller små bokstäver.
  • De slutar alltid med ändelsen txt.

Du är inte säker på om du ska ta bort dem direkt. Därför skriver du ett skript för att hitta dem och lagra dem i en separat datamängd.

Du noterar några metatecken som kan hjälpa dig: ^ förankrar till början, . matchar vilket tecken som helst.

Variabeln sentiment_analysis med texten från två tweets samt modulen re är redan inlästa i din session. Du kan använda print() för att visa innehållet i IPython Shell.

Den här övningen är en del av kursen

Reguljära uttryck i Python

Visa kurs

Övningsinstruktioner

  • Skriv ett regex som matchar mönstret för textfilnamn, till exempel aemyfile.txt.
  • Hitta alla träffar för regexet i elementen i sentiment_analysis. Skriv ut resultatet.
  • Ersätt alla träffar för regexet med en tom sträng "". Skriv ut resultatet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
Redigera och kör kod