영화 태그라인을 위한 BoW 모델
이 연습 문제에서는 7,000개가 넘는 영화 태그라인으로 구성된 corpus가 제공됩니다. 여러분의 과제는 이 태그라인에 대한 bag-of-words 표현인 bow_matrix를 생성하는 것입니다. 이번 연습에서는 텍스트 전처리 단계는 생략하고, 바로 bow_matrix를 생성하겠습니다.
또한 생성된 bow_matrix의 형태도 살펴보겠습니다. corpus의 처음 다섯 개 태그라인은 확인할 수 있도록 콘솔에 출력되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 NLP 피처 엔지니어링
연습 안내
sklearn에서CountVectorizer클래스를 가져오세요.CountVectorizer객체를 생성하고 이름을vectorizer로 지정하세요.fit_transform()을 사용해corpus에 대한bow_matrix를 생성하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Print the shape of bow_matrix
print(bow_matrix.shape)