시작하기무료로 시작하기

드물게 나타나는 범주 처리하기

어떤 특성은 매우 많은 범주를 가질 수 있지만, 각 범주의 등장 빈도는 고르지 않을 수 있어요. 예를 들어, Data Science에서 즐겨 사용하는 프로그래밍 언어를 생각해 보면, 흔한 선택지는 Python, R, Julia 등이지만, FORTRAN, C처럼 개별적인 선택도 존재합니다. 이런 경우에는 각 값마다 피처를 만들기보다, 더 자주 나타나는 값들만 대상으로 피처를 만드는 편이 좋습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Machine Learning 특성 공학

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create a series out of the Country column
countries = so_survey_df.____

# Get the counts of each category
country_counts = countries.____

# Print the count values for each category
print(country_counts)
코드 편집 및 실행