드물게 나타나는 범주 처리하기
어떤 특성은 매우 많은 범주를 가질 수 있지만, 각 범주의 등장 빈도는 고르지 않을 수 있어요. 예를 들어, Data Science에서 즐겨 사용하는 프로그래밍 언어를 생각해 보면, 흔한 선택지는 Python, R, Julia 등이지만, FORTRAN, C처럼 개별적인 선택도 존재합니다. 이런 경우에는 각 값마다 피처를 만들기보다, 더 자주 나타나는 값들만 대상으로 피처를 만드는 편이 좋습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Machine Learning 특성 공학
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create a series out of the Country column
countries = so_survey_df.____
# Get the counts of each category
country_counts = countries.____
# Print the count values for each category
print(country_counts)