Problema de múltiplas comparações
O problema de múltiplas comparações surge quando um pesquisador testa repetidamente diferentes variáveis/amostras umas contra as outras em busca de significância. Por puro acaso, esperamos encontrar resultados ocasionalmente significativos.
Neste exercício, você vai trabalhar com dados de salários de funcionários da cidade de Austin, TX. Você vai comparar esses salários com dados gerados aleatoriamente. Vai ver com que frequência esses dados aleatórios são "significativos" para explicar os salários dos funcionários. Qualquer "significância" assim seria claramente espúria, já que números aleatórios não ajudam muito a explicar nada!
Um DataFrame com salários de policiais (police_salaries_df) já foi carregado para você, assim como os pacotes pandas como pd, NumPy como np, Matplotlib como plt e stats do SciPy.
Este exercicio faz parte do curso
Fundamentos de Inferência em Python
Instruções do exercicio
- Armazene o número de pessoas no conjunto de dados em
n_rows(cada linha é uma pessoa) e inicialize o número de resultados significativos,n_significant, como zero. - Escreva um loop
forque rode 1000 vezes e geren_rowsnúmeros aleatórios. - Calcule o R de Pearson e o p-valor associado entre esses números gerados aleatoriamente e os salários dos policiais.
- Se o p-valor for significativo a 5%, some um a
n_significantusando o operador+=.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Compute number of rows and initialize n_significant
n_rows = ____
n_significant = ____
# For loop which generates n_rows random numbers 1000 times
for i in ____:
random_nums = np.random.uniform(size=____)
# Compute correlation between random_nums and police salaries
r, p_value = stats.____(____, random_nums)
# If the p-value is significant at 5%, increment n_significant
if ____ < ____:
____ += 1
print(n_significant)