시작하기무료로 시작하기

결측값 비율 필터 만들기

house_sales_df 데이터 프레임에는 타깃 변수 price와 개별 주택의 특성을 설명하고 판매 가격을 결정하는 다양한 예측 변수가 들어 있어요. 여러 특성에는 서로 다른 개수의 결측값이 있습니다. 결측값 비율이 너무 높으면 그 특성은 주택 가격을 예측하는 데 정보량이 충분하지 않을 수 있어요. 이런 특성은 제거할 수 있습니다. 이번 연습에서는 각 열의 결측값 비율을 계산해 보겠습니다. 이를 통해 각 열에 적절한 임계값을 설정하는 데 도움을 받을 수 있어요.

tidyverse 패키지는 미리 불러왔습니다.

이 연습은 강의의 일부입니다

R에서의 차원 축소

강의 보기

연습 안내

  • house_sales_df의 전체 행 수를 n에 저장하세요.
  • house_sales_df의 각 열에 대한 결측값 비율을 계산해 missing_vals_df에 저장하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Calculate total rows
___ <-  ___(___)

# Calculate missing value ratios
___ <- ___ %>% 
  ___(___(___(), ~ ___(___(.)))) %>% 
  pivot_longer(everything(), names_to = "feature", values_to = "num_missing_values") %>% 
  mutate(missing_val_ratio = ___ / ___)

# Display missing value ratios
missing_vals_df
코드 편집 및 실행