가장 흔한 단어 찾기
특징을 만들었다면, 기대한 대로 생성되었는지 확인하는 것이 항상 좋습니다. 이렇게 하면 오류를 조기에 발견할 수 있고, 이후 어떤 추가적인 feature engineering이 필요한지 판단하는 데도 도움이 돼요.
이전 연습 문제에서 학습한 벡터라이저(cv)와 단어 빈도로 구성된 희소 배열(cv_trigram)이 작업 공간에 준비되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Machine Learning 특성 공학
연습 안내
- 특징(단어 빈도)으로 DataFrame을 만드세요.
- 단어 출현 빈도의 합계를 구하고, 가장 많이 나타난 상위 5개 단어를 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create a DataFrame of the features
cv_tri_df = ____(____,
columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')
# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())