Găsirea fișierelor
Nu ești mulțumit(ă) de curățarea setului de date cu tweet-uri. Mai există șiruri suplimentare care nu oferă nicio informație despre sentiment. Printre acestea se numără șiruri care fac referire la nume de fișiere text.
Ai găsit și o metodă de a le detecta:
- Apar la începutul șirului.
- Încep întotdeauna cu o secvență de 2 sau 3 vocale, mari sau mici (a e i o u).
- Se termină întotdeauna cu sufixul
txt.
Nu ești sigur(ă) dacă ar trebui să le elimini direct. Așa că scrii un script pentru a le găsi și a le stoca într-un set de date separat.
Notezi câteva metacaractere utile: ^ pentru ancorarea la început și . pentru orice caracter.
Variabila sentiment_analysis, care conține textul a două tweet-uri, precum și modulul re sunt deja încărcate în sesiunea ta. Poți folosi print() pentru a le vizualiza în Shell-ul IPython.
Acest exercițiu face parte din cursul
Expresii regulate în Python
Instrucțiuni pentru exercițiu
- Scrie un regex care să corespundă tipului de nume de fișiere text, de exemplu
aemyfile.txt. - Găsește toate potrivirile regex-ului în elementele lui
sentiment_analysis. Afișează rezultatul. - Înlocuiește toate potrivirile regex-ului cu un șir gol
"". Afișează rezultatul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))