Hitta filer
Du är inte nöjd med rensningen av din tweets-datamängd. Det finns fortfarande extra strängar som inte tillför någon sentimentinformation. Bland dessa finns strängar som refererar till textfilnamn.
Du hittar ett sätt att identifiera dem:
- De förekommer i början av strängen.
- De börjar alltid med en sekvens av 2 eller 3 vokaler (a e i o u) i stora eller små bokstäver.
- De slutar alltid med ändelsen
txt.
Du är inte säker på om du ska ta bort dem direkt. Därför skriver du ett skript för att hitta dem och lagra dem i en separat datamängd.
Du noterar några metatecken som kan hjälpa dig: ^ förankrar till början, . matchar vilket tecken som helst.
Variabeln sentiment_analysis med texten från två tweets samt modulen re är redan inlästa i din session. Du kan använda print() för att visa innehållet i IPython Shell.
Den här övningen är en del av kursen
Reguljära uttryck i Python
Övningsinstruktioner
- Skriv ett regex som matchar mönstret för textfilnamn, till exempel
aemyfile.txt. - Hitta alla träffar för regexet i elementen i
sentiment_analysis. Skriv ut resultatet. - Ersätt alla träffar för regexet med en tom sträng
"". Skriv ut resultatet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))