Comece agoraComece grátis

Iterar e filtrar

Como consultor(a) de dados, você recebe dados nos mais diversos formatos. Um cliente acabou de transferir um arquivo CSV de 40 gigabytes com dados sobre instituições de ensino superior ao redor do mundo.

Os analistas juniores não conseguem processar os dados corretamente por falta de memória, e não há orçamento para os recursos computacionais necessários para lidar com todo o conjunto de dados. Sua análise atual precisa apenas das instituições da Austrália. O caminho do arquivo CSV já está armazenado na variável filepath. Pediram para você implementar um leitor eficiente para esses dados. Os pacotes parallel, doParallel, foreach e iterators já foram carregados para você.

Este exercicio faz parte do curso

Programação Paralela em R

Ver curso

Instruções do exercicio

  • Use um iterador para ler linhas de filepath.
  • Combine os resultados usando uma função apropriada para criar um data frame.
  • Especifique o operador paralelo.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

cl <- makeCluster(4)
registerDoParallel(cl)
# Use an iterator to read lines
foreach(l = ___,
        # Combine the lines as rows
        ___ = ___
        # Use the parallel operator
        ) ___ {
  line <- strsplit(l, ",")[[1]]
  if (line[4] == "Australia") {
    return(line)
  }
}

stopCluster(cl)
Editar e Executar Código