ÎncepețiÎncepe gratuit

Găsirea fișierelor

Nu ești mulțumit(ă) de curățarea setului de date cu tweet-uri. Mai există șiruri suplimentare care nu oferă nicio informație despre sentiment. Printre acestea se numără șiruri care fac referire la nume de fișiere text.

Ai găsit și o metodă de a le detecta:

  • Apar la începutul șirului.
  • Încep întotdeauna cu o secvență de 2 sau 3 vocale, mari sau mici (a e i o u).
  • Se termină întotdeauna cu sufixul txt.

Nu ești sigur(ă) dacă ar trebui să le elimini direct. Așa că scrii un script pentru a le găsi și a le stoca într-un set de date separat.

Notezi câteva metacaractere utile: ^ pentru ancorarea la început și . pentru orice caracter.

Variabila sentiment_analysis, care conține textul a două tweet-uri, precum și modulul re sunt deja încărcate în sesiunea ta. Poți folosi print() pentru a le vizualiza în Shell-ul IPython.

Acest exercițiu face parte din cursul

Expresii regulate în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Scrie un regex care să corespundă tipului de nume de fișiere text, de exemplu aemyfile.txt.
  • Găsește toate potrivirile regex-ului în elementele lui sentiment_analysis. Afișează rezultatul.
  • Înlocuiește toate potrivirile regex-ului cu un șir gol "". Afișează rezultatul.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
Editează și rulează codul