시작하기무료로 시작하기

가장 흔한 단어 찾기

특징을 만들었다면, 기대한 대로 생성되었는지 확인하는 것이 항상 좋습니다. 이렇게 하면 오류를 조기에 발견할 수 있고, 이후 어떤 추가적인 feature engineering이 필요한지 판단하는 데도 도움이 돼요.

이전 연습 문제에서 학습한 벡터라이저(cv)와 단어 빈도로 구성된 희소 배열(cv_trigram)이 작업 공간에 준비되어 있습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Machine Learning 특성 공학

강의 보기

연습 안내

  • 특징(단어 빈도)으로 DataFrame을 만드세요.
  • 단어 출현 빈도의 합계를 구하고, 가장 많이 나타난 상위 5개 단어를 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create a DataFrame of the features
cv_tri_df = ____(____, 
                 columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')

# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())
코드 편집 및 실행