Comece agoraComece grátis

Problema de múltiplas comparações

O problema de múltiplas comparações surge quando um pesquisador testa repetidamente diferentes variáveis/amostras umas contra as outras em busca de significância. Por puro acaso, esperamos encontrar resultados ocasionalmente significativos.

Neste exercício, você vai trabalhar com dados de salários de funcionários da cidade de Austin, TX. Você vai comparar esses salários com dados gerados aleatoriamente. Vai ver com que frequência esses dados aleatórios são "significativos" para explicar os salários dos funcionários. Qualquer "significância" assim seria claramente espúria, já que números aleatórios não ajudam muito a explicar nada!

Um DataFrame com salários de policiais (police_salaries_df) já foi carregado para você, assim como os pacotes pandas como pd, NumPy como np, Matplotlib como plt e stats do SciPy.

Este exercicio faz parte do curso

Fundamentos de Inferência em Python

Ver curso

Instruções do exercicio

  • Armazene o número de pessoas no conjunto de dados em n_rows (cada linha é uma pessoa) e inicialize o número de resultados significativos, n_significant, como zero.
  • Escreva um loop for que rode 1000 vezes e gere n_rows números aleatórios.
  • Calcule o R de Pearson e o p-valor associado entre esses números gerados aleatoriamente e os salários dos policiais.
  • Se o p-valor for significativo a 5%, some um a n_significant usando o operador +=.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Compute number of rows and initialize n_significant
n_rows = ____
n_significant = ____

# For loop which generates n_rows random numbers 1000 times
for i in ____:
  random_nums = np.random.uniform(size=____)
  # Compute correlation between random_nums and police salaries
  r, p_value = stats.____(____, random_nums)
  # If the p-value is significant at 5%, increment n_significant
  if ____ < ____:
    ____ += 1
    
print(n_significant)
Editar e Executar Código