시작하기무료로 시작하기

TF-IDF 모델 인스턴스화하기

기본 설정의 TF-IDF는 모든 문서(이 예제에서는 영화 줄거리)에 등장하는 모든 단어에 대해 하나의 열을 생성해요. 이렇게 하면 모든 문서에 공통으로 나타나는 매우 흔한 단어와, 너무 드물게 나타나서 항목 간 유사도 파악에 도움이 되지 않는 단어가 함께 포함되어, 거대하고 직관적이지 않은 데이터셋이 만들어집니다.

이번 연습에서는 df_plots DataFrame을 사용해요. Title 열에는 영화 제목이, Plot 열에는 줄거리가 들어 있어요.

이 DataFrame을 사용해 기본 TF-IDF 점수를 생성하고, 가치가 낮은 열들이 포함되어 있는지 확인해 보세요.

그다음에는 min_dfmax_df 인자를 사용해 열 수를 제한하도록 TF-IDF 계산을 다시 수행하고, 개선 효과를 확인해 보겠습니다.

이 연습은 강의의 일부입니다

Python으로 추천 엔진 만들기

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()

# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])

# Look at the features generated
print(____.____())
코드 편집 및 실행