시작하기무료로 시작하기

특징 인덱스를 특징 이름과 매핑하기

강의 영상에서 CountVectorizer가 어휘를 반드시 사전순으로 인덱싱하지는 않는다는 점을 살펴봤습니다. 이번 연습에서는 각 특징 인덱스를 어휘의 해당 특징 이름과 매핑하는 방법을 익히겠습니다.

영상에서 사용했던 사자에 관한 세 문장을 그대로 사용합니다. 문장들은 corpus라는 리스트에 들어 있으며, 이미 콘솔에 출력되어 있습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 NLP 피처 엔지니어링

강의 보기

연습 안내

  • CountVectorizer 객체를 인스턴스화하세요. 이름은 vectorizer로 하세요.
  • fit_transform()을 사용해 corpus에 대한 bow_matrix를 생성하세요.
  • get_feature_names() 메서드를 사용해 열 이름을 어휘의 해당 단어와 매핑하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create CountVectorizer object
vectorizer = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())

# Map the column names to vocabulary 
bow_df.columns = vectorizer.____

# Print bow_df
print(bow_df)
코드 편집 및 실행