시작하기무료로 시작하기

파일 찾기

트윗 데이터셋 정리에 아직 만족하지 못했어요. 감정 정보를 제공하지 않는 불필요한 문자열이 여전히 남아 있습니다. 그중에는 텍스트 파일 이름을 가리키는 문자열이 있어요.

다음과 같은 방식으로 이를 찾아낼 수 있다는 것도 확인했어요:

  • 문자열의 시작 부분에 나타납니다.
  • 항상 대소문자 모음(a e i o u) 2~3개로 시작합니다.
  • 항상 txt로 끝납니다.

바로 제거해야 할지 확신이 서지 않아서, 먼저 찾아서 별도의 데이터셋에 저장하는 스크립트를 작성하려고 합니다.

도움이 될 메타문자를 메모해 두었어요: 시작 고정은 ^, 임의의 한 글자는 .입니다.

두 개의 트윗 텍스트가 들어 있는 변수 sentiment_analysisre 모듈은 세션에 이미 로드되어 있어요. IPython 셸에서 print()로 내용을 확인할 수 있습니다.

이 연습은 강의의 일부입니다

Python에서의 정규 표현식

강의 보기

연습 안내

  • 텍스트 파일 이름 패턴과 일치하는 정규식을 작성하세요. 예: aemyfile.txt.
  • sentiment_analysis의 각 요소에서 정규식과 일치하는 모든 항목을 찾으세요. 결과를 출력하세요.
  • 정규식과 일치하는 모든 항목을 빈 문자열 ""로 바꾸세요. 결과를 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
코드 편집 및 실행