결측값 비율 필터 만들기
house_sales_df 데이터 프레임에는 타깃 변수 price와 개별 주택의 특성을 설명하고 판매 가격을 결정하는 다양한 예측 변수가 들어 있어요. 여러 특성에는 서로 다른 개수의 결측값이 있습니다. 결측값 비율이 너무 높으면 그 특성은 주택 가격을 예측하는 데 정보량이 충분하지 않을 수 있어요. 이런 특성은 제거할 수 있습니다. 이번 연습에서는 각 열의 결측값 비율을 계산해 보겠습니다. 이를 통해 각 열에 적절한 임계값을 설정하는 데 도움을 받을 수 있어요.
tidyverse 패키지는 미리 불러왔습니다.
이 연습은 강의의 일부입니다
R에서의 차원 축소
연습 안내
house_sales_df의 전체 행 수를n에 저장하세요.house_sales_df의 각 열에 대한 결측값 비율을 계산해missing_vals_df에 저장하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Calculate total rows
___ <- ___(___)
# Calculate missing value ratios
___ <- ___ %>%
___(___(___(), ~ ___(___(.)))) %>%
pivot_longer(everything(), names_to = "feature", values_to = "num_missing_values") %>%
mutate(missing_val_ratio = ___ / ___)
# Display missing value ratios
missing_vals_df