리뷰 정규화하기
이제 영화 리뷰 데이터셋에서 중요한 단어들을 추출해 보겠습니다. 먼저 정규화를 수행한 뒤, 단어 빈도를 세어야 해요. 정규화 과정에는 모든 단어를 소문자로 변환하고, 특수 문자를 제거하며, 단어의 어근을 추출해서 변형된 형태들을 하나로 세는 작업이 포함됩니다.
예를 들어, 다음과 같은 리뷰가 있다고 해볼게요: The movie surprises me very much와 Marvel movies always surprise their audience. 단어 빈도를 그대로 세면 surprises는 한 번, surprise는 한 번으로 집계됩니다. 하지만 동사 surprise는 두 문장 모두에 나타나므로 빈도는 두 번이 되어야 합니다.
한 개의 예제로 사용할 영화 리뷰 텍스트가 변수 movie에 이미 저장되어 있습니다. IPython 셸에서 print(movie)를 사용해 변수를 확인할 수 있어요.
이 연습은 강의의 일부입니다
Python에서의 정규 표현식
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Convert to lowercase and print the result
movie_lower = ____
print(____)