Hledání souborů
S čištěním datasetu tweetů nejsi úplně spokojený/á. Stále v něm zůstávají řetězce, které nepřinášejí žádnou informaci o sentimentu. Patří mezi ně i řetězce odkazující na názvy textových souborů.
Nacházíš způsob, jak je rozpoznat:
- Vyskytují se na začátku řetězce.
- Vždy začínají sekvencí 2 nebo 3 velkých nebo malých samohlásek (a e i o u).
- Vždy končí koncovkou
txt.
Nejsi si jistý/á, zda je rovnou odstranit. Proto napíšeš skript, který je najde a uloží do samostatného datasetu.
Zapíšeš si několik metacharakterů, které ti pomohou: ^ ukotvení na začátek, . libovolný znak.
Proměnná sentiment_analysis obsahující text dvou tweetů a modul re jsou již načtené v tvé session. Obsah si můžeš zobrazit pomocí print() v IPython Shellu.
Toto cvičení je součástí kurzu
Regular Expressions in Python
Pokyny k cvičení
- Napiš regex, který odpovídá vzoru názvů textových souborů, například
aemyfile.txt. - Najdi všechny shody regexu v prvcích
sentiment_analysis. Vypiš výsledek. - Nahraď všechny shody regexu prázdným řetězcem
"". Vypiš výsledek.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))