다른 이름도 찾아봐요
여러분은 계속해서 Twitter 감성 분석을 진행하고 있어요. 이번에는 눈에 띈 몇 가지를 살펴보려 합니다. 일부 트윗에 이메일 주소가 포함되어 있다는 것을 발견했어요. 이제 가장 흔한 이름이 무엇인지 궁금해졌습니다.
이메일의 첫 부분을 추출하려고 해요. 예를 들어 이메일이 [email protected]이라면, 관심 있는 부분은 marysmith90뿐입니다.
전체 표현식이 일치하도록 만들어야 해요. 그래야 이메일에 실제로 있는 이름만 추출할 수 있습니다. 또한 대문자(예: A, B, Z)나 소문자(예: a, d, z), 숫자를 포함한 이름만 관심 있습니다.
세 개의 트윗 텍스트가 담긴 리스트 sentiment_analysis와 re 모듈이 세션에 로드되어 있어요. IPython 셸에서 print()로 내용을 확인할 수 있습니다.
이 연습은 강의의 일부입니다
Python에서의 정규 표현식
연습 안내
@앞에 나타나는 이름 부분만 캡처하도록 이메일을 일치시키는 정규식을 완성하세요.sentiment_analysis의 각 요소에서 정규식의 모든 일치를 찾아email_matched변수에 할당하세요.sentiment_analysis의 각 요소에서 캡처된 결과를 출력하도록.format()메서드를 완성하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Write a regex that matches email
regex_email = r"___[____]____\S+"
for tweet in sentiment_analysis:
# Find all matches of regex in each tweet
email_matched = re.____(____, ____)
# Complete the format method to print the results
print("Lists of users found in this tweet: {}".format(____))