시작하기무료로 시작하기

책 소개 글에 TF-IDF 적용하기

PyBooks는 여러 책의 소개 글을 수집했고, TF-IDF 인코딩 기법을 사용해 그 안에서 중요한 단어를 찾아내려 합니다. 이를 통해 각 책의 고유한 특성을 더 잘 파악해 추천 시스템을 개선하려고 해요.

다음 패키지는 이미 임포트되어 있습니다: torch, torchtext.

이 연습은 강의의 일부입니다

PyTorch로 배우는 텍스트 딥러닝

강의 보기

연습 안내

  • 원시 문서 모음을 TF-IDF 특성 행렬로 변환하는 sklearn.feature_extraction.textTfidfVectorizer 클래스를 임포트하세요.
  • 이 클래스의 객체를 생성한 뒤, 이 객체를 사용해 descriptions를 TF-IDF 벡터 행렬로 인코딩하세요.
  • vectorizer에서 특성 이름의 처음 다섯 개를, 그리고 tfidf_encoded_descriptions에서 인코딩된 벡터를 가져와 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
코드 편집 및 실행