Bestanden zoeken
Je bent nog niet tevreden over het opschonen van je tweets-gegevensset. Er staan nog steeds extra strings in die geen sentiment toevoegen. Daaronder zitten strings die verwijzen naar tekstbestandsnamen.
Je hebt ook een manier gevonden om ze te detecteren:
- Ze staan aan het begin van de string.
- Ze beginnen altijd met een reeks van 2 of 3 klinkers in kleine of hoofdletters (a e i o u).
- Ze eindigen altijd met de
txt-uitgang.
Je weet niet zeker of je ze direct moet verwijderen. Daarom schrijf je een script om ze te vinden en in een aparte gegevensset op te slaan.
Je noteert enkele metatekens om je te helpen: ^ verankering aan het begin, . elk teken.
De variabele sentiment_analysis met de tekst van twee tweets en de module re zijn al in je sessie geladen. Je kunt print() gebruiken om deze in de IPython-shell te bekijken.
Deze oefening maakt deel uit van de cursus
Regular expressions in Python
Oefeninstructies
- Schrijf een regex die het patroon van de tekstbestandsnamen matcht, bijvoorbeeld
aemyfile.txt. - Zoek alle matches van de regex in de elementen van
sentiment_analysis. Print het resultaat. - Vervang alle matches van de regex door een lege string
"". Print het resultaat.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))