시작하기무료로 시작하기

Corr() 사용하기

‘상관관계가 인과관계를 의미하지는 않는다’는 말은 중요한 경고예요. 그렇지만 상관관계는 모델에 사용할 유망한 특성을 어디서부터 찾아봐야 할지 방향을 잡는 데 도움이 됩니다. 이번 연습에서는 데이터를 처음 탐색한다는 느낌으로, 패턴을 찾아보는 과정을 익혀 보세요.

열 이름을 담은 columns 리스트가 미리 준비되어 있습니다. 이 연습에서는 해당 열들과 'SALESCLOSEPRICE' 간의 상관관계를 계산하고, 그중 최댓값을 찾아보겠습니다.

이 연습은 강의의 일부입니다

PySpark로 하는 Feature Engineering

강의 보기

연습 안내

  • for 루프를 사용해 columns를 순회하세요.
  • 각 루프마다 현재 열과 'SALESCLOSEPRICE'의 상관관계를 corr() 메서드로 계산하세요.
  • 관측된 최대 상관계수와 그에 해당하는 열을 갱신하는 로직을 작성하세요.
  • 'SALESCLOSEPRICE'와 상관관계가 가장 큰 열 이름을 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
코드 편집 및 실행