Blokowanie danych eksperymentalnych
Pracujesz z firmą produkcyjną, która chce przeprowadzić eksperymenty dotyczące wydajności pracowników. Ich zbiór danych zawiera tylko 100 wierszy, dlatego ważne jest, aby grupy eksperymentalne były zrównoważone.
To doskonała okazja, by wykorzystać wiedzę o blokowaniu i im pomóc. Firma udostępniła DataFrame productivity_subjects. Podziel ten zbiór danych na dwie równe grupy po 50 wpisów każda.
Biblioteki numpy i pandas zostały zaimportowane odpowiednio jako np i pd.
To ćwiczenie jest częścią kursu
Projektowanie eksperymentów w Pythonie
Instrukcje do ćwiczenia
- Losowo wybierz 50 obserwacji z DataFrame
productivity_subjectsdo nowego DataFrameblock_1, bez zwracania. - Ustaw nową kolumnę
blockna wartość 1 dla DataFrameblock_1. - Przypisz pozostałe obserwacje do DataFrame o nazwie
block_2i ustaw kolumnęblockna wartość 2 dla tego DataFrame. - Połącz oba bloki w jeden DataFrame, a następnie wyświetl liczbę wystąpień każdej wartości w kolumnie
block, aby potwierdzić, że blokowanie zadziałało poprawnie.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Randomly assign half
block_1 = productivity_subjects.____(____, random_state=42, ____)
# Set the block column
block_1['block'] = ____
# Create second assignment and label
block_2 = ____
block_2['block'] = ____
# Concatenate and print
productivity_combined = pd.____([block_1, block_2], axis=0)
print(productivity_combined['block'].value_counts())