완벽하게 정리하기
Twitter 감성 분석 프로젝트로 돌아가 볼까요? 감성 분석을 복잡하게 만드는 문자열 유형이 여럿 있지만, 실제로 감성에는 도움이 되지 않는 것들도 있습니다. 예를 들어 링크와 사용자 멘션이 그렇습니다.
트윗을 정리(clean)하려면 먼저 몇 가지 예시를 추출해 보려 합니다. 대부분의 링크는 http로 시작하고 공백을 포함하지 않는다는 것을 알고 있어요. 예: https://www.datacamp.com. 사용자 멘션은 @로 시작하며 문자와 숫자만 포함할 수 있습니다. 예: @johnsmith3.
도움이 될 만한 수량자를 적어 두었습니다: * 0회 이상, + 1회 이상, ? 0회 또는 1회.
세 개 트윗의 텍스트가 담긴 리스트 sentiment_analysis는 이미 세션에 로드되어 있습니다. IPython 셸에서 print()로 데이터를 확인할 수 있어요.
이 연습은 강의의 일부입니다
Python에서의 정규 표현식
연습 안내
re모듈을 임포트하세요.sentiment_analysis의 각tweet에서 나타나는http링크의 모든 일치를 찾는 정규식을 작성하고, 결과를 출력하세요.sentiment_analysis의 각tweet에서 나타나는 사용자 멘션의 모든 일치를 찾는 정규식을 작성하고, 결과를 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))