시작하기무료로 시작하기

실험 데이터 블로킹

여러분은 노동 생산성에 대한 실험을 진행하려는 한 제조업체와 함께 일하고 있어요. 데이터셋은 100행뿐이라, 실험 집단의 균형을 맞추는 것이 중요해요.

이럴 때 블로킹 지식이 큰 도움이 되겠죠. 제공된 productivity_subjects DataFrame을 사용해 주세요. 주어진 데이터셋을 각각 50개 항목으로 이루어진 두 개의 동일한 그룹으로 분할하세요.

라이브러리 numpypandas는 각각 np, pd로 임포트되어 있어요.

이 연습은 강의의 일부입니다

Python으로 배우는 실험 설계

강의 보기

연습 안내

  • productivity_subjects DataFrame에서 복원 추출 없이 임의로 50명을 선택해 새로운 DataFrame block_1을 만드세요.
  • block_1 DataFrame에 새 열 block을 추가하고 값을 1로 설정하세요.
  • 남은 대상들을 block_2라는 DataFrame에 넣고, 이 DataFrame의 block 열 값을 2로 설정하세요.
  • 두 블록(DataFrame)을 하나로 이어 붙인 뒤, 블로킹이 제대로 되었는지 확인하기 위해 block 열의 각 값에 대한 개수를 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Randomly assign half
block_1 = productivity_subjects.____(____, random_state=42, ____)

# Set the block column
block_1['block'] = ____

# Create second assignment and label
block_2 = ____
block_2['block'] = ____

# Concatenate and print
productivity_combined = pd.____([block_1, block_2], axis=0)
print(productivity_combined['block'].value_counts())
코드 편집 및 실행