Blocarea datelor experimentale
Lucrezi cu o firmă de producție care dorește să realizeze experimente privind productivitatea angajaților. Setul lor de date conține doar 100 de rânduri, așadar este important ca grupurile experimentale să fie echilibrate.
Acesta este un moment potrivit să îți folosești cunoștințele despre blocare pentru a-i ajuta. Ei au pus la dispoziție un DataFrame numit productivity_subjects. Împarte setul de date în două grupuri egale, de câte 50 de înregistrări fiecare.
Bibliotecile numpy și pandas au fost importate ca np și, respectiv, pd.
Acest exercițiu face parte din cursul
Design experimental în Python
Instrucțiuni pentru exercițiu
- Selectează aleatoriu 50 de subiecți din DataFrame-ul
productivity_subjectsîntr-un nou DataFrameblock_1, fără înlocuire. - Adaugă o coloană nouă,
block, cu valoarea 1 pentru DataFrame-ulblock_1. - Atribuie subiecții rămași unui DataFrame numit
block_2și setează coloanablockla valoarea 2 pentru acest DataFrame. - Concatenează cele două blocuri într-un singur DataFrame și afișează numărul de apariții al fiecărei valori din coloana
blockpentru a confirma că blocarea a funcționat corect.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Randomly assign half
block_1 = productivity_subjects.____(____, random_state=42, ____)
# Set the block column
block_1['block'] = ____
# Create second assignment and label
block_2 = ____
block_2['block'] = ____
# Concatenate and print
productivity_combined = pd.____([block_1, block_2], axis=0)
print(productivity_combined['block'].value_counts())