EmpezarEmpieza gratis

Iterar y filtrar

Como consultor de datos, recibes datos en todas las formas y formatos. Un cliente acaba de transferir un archivo CSV de 40 gigabytes que contiene datos sobre instituciones de estudios superiores de todo el mundo.

Los analistas junior no pueden analizar los datos correctamente por falta de memoria, y no hay presupuesto para los recursos informáticos necesarios para manejar todo el conjunto de datos. Tu análisis actual sólo requiere el análisis de los institutos de Australia. La ruta del archivo CSV ya está almacenada en la variable filepath. Se te ha pedido que implementes un lector eficiente para estos datos. parallel Se han cargado para ti los paquetes doParallel, foreach y iterators.

Este ejercicio forma parte del curso

Programación paralela en R

Ver curso

Instrucciones del ejercicio

  • Utiliza un iterador para leer líneas de filepath.
  • Combina los resultados utilizando una función adecuada para crear un marco de datos.
  • Especifica el operador paralelo.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

cl <- makeCluster(4)
registerDoParallel(cl)
# Use an iterator to read lines
foreach(l = ___,
        # Combine the lines as rows
        ___ = ___
        # Use the parallel operator
        ) ___ {
  line <- strsplit(l, ",")[[1]]
  if (line[4] == "Australia") {
    return(line)
  }
}

stopCluster(cl)
Editar y ejecutar código