Začněte nyníZačněte zdarma

Hledání souborů

S čištěním datasetu tweetů nejsi úplně spokojený/á. Stále v něm zůstávají řetězce, které nepřinášejí žádnou informaci o sentimentu. Patří mezi ně i řetězce odkazující na názvy textových souborů.

Nacházíš způsob, jak je rozpoznat:

  • Vyskytují se na začátku řetězce.
  • Vždy začínají sekvencí 2 nebo 3 velkých nebo malých samohlásek (a e i o u).
  • Vždy končí koncovkou txt.

Nejsi si jistý/á, zda je rovnou odstranit. Proto napíšeš skript, který je najde a uloží do samostatného datasetu.

Zapíšeš si několik metacharakterů, které ti pomohou: ^ ukotvení na začátek, . libovolný znak.

Proměnná sentiment_analysis obsahující text dvou tweetů a modul re jsou již načtené v tvé session. Obsah si můžeš zobrazit pomocí print() v IPython Shellu.

Toto cvičení je součástí kurzu

Regular Expressions in Python

Zobrazit kurz

Pokyny k cvičení

  • Napiš regex, který odpovídá vzoru názvů textových souborů, například aemyfile.txt.
  • Najdi všechny shody regexu v prvcích sentiment_analysis. Vypiš výsledek.
  • Nahraď všechny shody regexu prázdným řetězcem "". Vypiš výsledek.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
Upravit a spustit kód