Dicas e truques de kNN II: ordenando variáveis

Como o algoritmo k-Nearest Neighbors percorre as variáveis do conjunto de dados para imputá-las, ele calcula distâncias entre observações usando outras variáveis, algumas das quais já foram imputadas nas etapas anteriores. Isso significa que, se as variáveis posicionadas antes nos dados tiverem muitos valores ausentes, o cálculo de distância subsequente será baseado em muitos valores imputados. Isso introduz ruído no cálculo das distâncias.

Por isso, é uma boa prática ordenar as variáveis de forma crescente pelo número de valores ausentes antes de realizar a imputação com kNN. Assim, cada cálculo de distância se baseia no máximo de dados observados e no mínimo de dados imputados.

Vamos testar isso com os dados tao!

Este exercicio faz parte do curso

Tratamento de Dados Ausentes com Imputações em R

Instruções do exercicio

Calcule o número de valores ausentes em cada coluna de tao na primeira parte do pipeline.
Em seguida, ordene as variáveis de forma crescente de acordo com o número de valores ausentes, extraia seus nomes e atribua o resultado a vars_by_NAs.
Use select() para reordenar as variáveis de tao usando a ordem salva em vars_by_NAs.
Realize a imputação por k-Nearest Neighbors nos dados reordenados e atribua o resultado a tao_imp.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Get tao variable names sorted by number of NAs
vars_by_NAs <- tao %>%
  ___ %>%
  colSums() %>%
  sort(decreasing = ___) %>% 
  names()

# Sort tao variables and feed it to kNN imputation
tao_imp <- tao %>% 
  select(___) %>% 
  ___()

tao_imp %>% 
	select(sea_surface_temp, humidity, humidity_imp) %>% 
	marginplot(delimiter = "imp")

Editar e Executar Código

Este exercicio faz parte do curso

Tratamento de Dados Ausentes com Imputações em R

AvançadoNível de habilidade

4.8+

Comece o curso gratuitamente

Neste capítulo, você vai entender por que dados ausentes podem representar um risco ao analisar um conjunto de dados. Você será apresentado aos três mecanismos de ausência de dados e aprenderá a reconhecê-los usando testes estatísticos e ferramentas de visualização.

Exercise 1: Dados ausentes: o que pode dar errado Exercise 2: Regressão linear com dados incompletos Exercise 3: Analisando a saída da regressão Exercise 4: Comparando modelos Exercise 5: Mecanismos de dados ausentes Exercise 6: Reconhecendo mecanismos de dados ausentes Exercise 7: teste t para MAR: preparação dos dados Exercise 8: teste t para MAR: interpretação Exercise 9: Visualizando padrões de dados ausentes Exercise 10: Gráfico de agregação Exercise 11: Gráfico spine Exercise 12: Gráfico mosaico

Conheça a taxonomia dos métodos de imputação e aprenda três técnicas baseadas em doadores: imputação pela média, hot-deck e k-Nearest-Neighbors. Você vai abrir a caixa-preta para ver como esses métodos funcionam antes de aplicá-los a um conjunto de dados de clima tropical do mundo real. No caminho, também vai aprender truques úteis para fazê-los funcionar ainda melhor nos seus problemas.

Exercise 1: Imputação pela média Exercise 2: Sentindo o perigo da imputação pela média Exercise 3: Imputando a média da temperatura Exercise 4: Avaliando a qualidade da imputação com margin plot Exercise 5: Imputação por hot-deck Exercise 6: Hot-deck simples Exercise 7: Dicas e truques de hot-deck I: imputando dentro de domínios Exercise 8: Dicas e truques de hot-deck II: ordenando por variáveis correlacionadas Exercise 9: Imputação por k-Nearest-Neighbors Exercise 10: Escolhendo o número de vizinhos Exercise 11: Dicas e truques do kNN I: ponderando doadores Exercise 12: Dicas e truques de kNN II: ordenando variáveis

Exercicio Atual

Chegou a hora de aprender a usar modelos estatísticos e de Machine Learning, como regressão linear, regressão logística e random forests, para imputar dados ausentes. Neste capítulo, você vai explorar como os modelos fazem suas previsões e usar esse conhecimento para sortear os valores imputados de distribuições condicionais. Isso é importante porque garante que suas imputações sejam mais variadas e plausíveis, tornando-as mais próximas dos dados verdadeiros.

Exercise 1: Abordagem de imputação baseada em modelo Exercise 2: Imputação com regressão linear Exercise 3: Inicializando valores ausentes e iterando sobre variáveis Exercise 4: Detectando convergência Exercise 5: Replicando a variabilidade dos dados Exercise 6: Imputação com regressão logística Exercise 7: Amostrando da distribuição condicional Exercise 8: Imputação baseada em modelo com múltiplos tipos de variáveis Exercise 9: Imputação baseada em árvores Exercise 10: Imputando com random forests Exercise 11: Erros de imputação por variável Exercise 12: Compensação entre velocidade e precisão

Valores imputados não são imutáveis. Eles são apenas estimativas, e estimativas vêm com incerteza. Neste capítulo final, você vai descobrir como o bootstrapping e as equações encadeadas com o pacote mice podem ser usados para incorporar a incerteza da imputação em seus modelos e análises, tornando-os mais confiáveis e robustos.

Exercise 1: Imputação múltipla por bootstrapping Exercise 2: Encapsulando imputação e modelagem em uma função Exercise 3: Executando o bootstrap Exercise 4: Intervalos de confiança por bootstrapping Exercise 5: Imputação múltipla por equações encadeadas Exercise 6: O fluxo do mice: mice - with - pool Exercise 7: Escolhendo modelos padrão Exercise 8: Usando a matriz de preditores Exercise 9: Juntando tudo Exercise 10: Analisando padrões de dados ausentes Exercise 11: Imputando e inspecionando resultados Exercise 12: Inferência com dados imputados Exercise 13: Considerações finais