Blockering av experimentdata
Du arbetar med ett tillverkningsföretag som vill genomföra experiment kring medarbetarnas produktivitet. Deras datamängd innehåller bara 100 rader, så det är viktigt att experimentgrupperna är balanserade.
Detta är ett utmärkt tillfälle att använda dina kunskaper om blockering. Företaget har tillhandahållit en DataFrame kallad productivity_subjects. Dela upp datamängden i två jämna grupper med 50 poster vardera.
Biblioteken numpy och pandas har importerats som np respektive pd.
Den här övningen är en del av kursen
Experimentell design i Python
Övningsinstruktioner
- Välj slumpmässigt 50 försökspersoner från
productivity_subjectsutan återläggning och spara dem i en ny DataFrame kalladblock_1. - Lägg till en ny kolumn,
block, och sätt värdet till 1 förblock_1. - Tilldela de återstående försökspersonerna till en DataFrame kallad
block_2och sättblock-kolumnen till 2 för denna DataFrame. - Sammanfoga blocken till en enda DataFrame och skriv ut antalet förekomster av varje värde i
block-kolumnen för att bekräfta att blockeringen fungerade.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Randomly assign half
block_1 = productivity_subjects.____(____, random_state=42, ____)
# Set the block column
block_1['block'] = ____
# Create second assignment and label
block_2 = ____
block_2['block'] = ____
# Concatenate and print
productivity_combined = pd.____([block_1, block_2], axis=0)
print(productivity_combined['block'].value_counts())