파일 찾기
트윗 데이터셋 정리에 아직 만족하지 못했어요. 감정 정보를 제공하지 않는 불필요한 문자열이 여전히 남아 있습니다. 그중에는 텍스트 파일 이름을 가리키는 문자열이 있어요.
다음과 같은 방식으로 이를 찾아낼 수 있다는 것도 확인했어요:
- 문자열의 시작 부분에 나타납니다.
- 항상 대소문자 모음(a e i o u) 2~3개로 시작합니다.
- 항상
txt로 끝납니다.
바로 제거해야 할지 확신이 서지 않아서, 먼저 찾아서 별도의 데이터셋에 저장하는 스크립트를 작성하려고 합니다.
도움이 될 메타문자를 메모해 두었어요: 시작 고정은 ^, 임의의 한 글자는 .입니다.
두 개의 트윗 텍스트가 들어 있는 변수 sentiment_analysis와 re 모듈은 세션에 이미 로드되어 있어요. IPython 셸에서 print()로 내용을 확인할 수 있습니다.
이 연습은 강의의 일부입니다
Python에서의 정규 표현식
연습 안내
- 텍스트 파일 이름 패턴과 일치하는 정규식을 작성하세요. 예:
aemyfile.txt. sentiment_analysis의 각 요소에서 정규식과 일치하는 모든 항목을 찾으세요. 결과를 출력하세요.- 정규식과 일치하는 모든 항목을 빈 문자열
""로 바꾸세요. 결과를 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))