데이터 시각화하기
이전 연습 문제에서 사기(fraud)와 정상(non-fraud) 관측치의 비율이 매우 낮다는 것을 확인했어요. 이에 대해서는 다음 영상에서 설명할 재표본추출(re-sampling) 같은 방법으로 대응할 수 있어요.
이번 연습에서는 데이터를 살펴보고 사기와 정상의 비율을 시각화해 보겠습니다. 사기 분석에서는 어떤 변경을 하기 전에 먼저 데이터를 확인하는 것이 항상 좋은 출발점이에요.
또한 동료들과 이야기할 때, 그림으로 보여 주면 데이터가 심하게 불균형하다는 점을 분명하게 전달할 수 있어요.
데이터셋 df에서 사기와 정상 데이터 포인트의 비율을 시각화하는 그래프를 만들어 봅시다.
prep_data() 함수와 matplotlib.pyplot의 별칭 plt는 이미 작업 공간에 로드되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 사기 탐지
연습 안내
주어진 특성 집합
X와 레이블y를 산점도로 보기 좋게 그려 주는plot_data(X, y)함수를 정의하세요. 이 부분은 이미 준비되어 있습니다.데이터셋
df에prep_data()함수를 적용해 특성 집합X와 레이블y를 만드세요.새로 얻은
X와y를 사용해plot_data()함수를 실행하고 결과를 시각화하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
plt.legend()
return plt.show()
# Create X and y from the prep_data function
X, y = prep_data(____)
# Plot our data by running our plot data function on X and y
____(X, y)