Blokování experimentálních dat
Pracuješ s výrobní firmou, která chce provést experimenty zaměřené na produktivitu pracovníků. Jejich dataset obsahuje pouze 100 řádků, takže je důležité, aby byly experimentální skupiny vyvážené.
To je skvělá příležitost využít znalosti blokování a pomoci jim. Firma ti poskytla DataFrame productivity_subjects. Rozděl tento dataset do dvou stejně velkých skupin po 50 záznamech.
Knihovny numpy a pandas jsou naimportované jako np a pd.
Toto cvičení je součástí kurzu
Experimentální design v Pythonu
Pokyny k cvičení
- Náhodně vyber 50 subjektů z DataFrame
productivity_subjectsdo nového DataFrameblock_1bez opakování. - Nastav nový sloupec
blockna hodnotu 1 pro DataFrameblock_1. - Přiřaď zbývající subjekty do DataFrame s názvem
block_2a nastav sloupecblockna hodnotu 2 pro tento DataFrame. - Spoj oba bloky do jednoho DataFrame a vypiš počet výskytů každé hodnoty ve sloupci
block, abys ověřil/a, že blokování proběhlo správně.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Randomly assign half
block_1 = productivity_subjects.____(____, random_state=42, ____)
# Set the block column
block_1['block'] = ____
# Create second assignment and label
block_2 = ____
block_2['block'] = ____
# Concatenate and print
productivity_combined = pd.____([block_1, block_2], axis=0)
print(productivity_combined['block'].value_counts())