Aan de slagBegin gratis

Bestanden zoeken

Je bent nog niet tevreden over het opschonen van je tweets-gegevensset. Er staan nog steeds extra strings in die geen sentiment toevoegen. Daaronder zitten strings die verwijzen naar tekstbestandsnamen.

Je hebt ook een manier gevonden om ze te detecteren:

  • Ze staan aan het begin van de string.
  • Ze beginnen altijd met een reeks van 2 of 3 klinkers in kleine of hoofdletters (a e i o u).
  • Ze eindigen altijd met de txt-uitgang.

Je weet niet zeker of je ze direct moet verwijderen. Daarom schrijf je een script om ze te vinden en in een aparte gegevensset op te slaan.

Je noteert enkele metatekens om je te helpen: ^ verankering aan het begin, . elk teken.

De variabele sentiment_analysis met de tekst van twee tweets en de module re zijn al in je sessie geladen. Je kunt print() gebruiken om deze in de IPython-shell te bekijken.

Deze oefening maakt deel uit van de cursus

Regular expressions in Python

Bekijk cursus

Oefeninstructies

  • Schrijf een regex die het patroon van de tekstbestandsnamen matcht, bijvoorbeeld aemyfile.txt.
  • Zoek alle matches van de regex in de elementen van sentiment_analysis. Print het resultaat.
  • Vervang alle matches van de regex door een lege string "". Print het resultaat.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
Code bewerken en uitvoeren