CommencezCommencez gratuitement

Itérer et filtrer

Comme conseiller ou conseillère en données, vous recevez des données sous toutes sortes de formats. Un client vient de transférer un fichier CSV de 40 gigaoctets contenant des données sur les établissements d'études supérieures partout dans le monde.

Les analystes juniors ne peuvent pas traiter correctement les données faute de mémoire, et il n'y a pas de budget pour les ressources de calcul nécessaires afin de gérer l'ensemble de l'ensemble de données. Votre analyse actuelle ne nécessite que l'étude des établissements en Australie. Le chemin d'accès du fichier CSV est déjà stocké dans la variable filepath. On vous a demandé de mettre en place un lecteur efficace pour ces données. Les paquets parallel, doParallel, foreach et iterators ont été chargés pour vous.

Cette activité fait partie du cours

Programmation parallèle en R

Voir le cours

Instructions de l’exercice

  • Utilisez un itérateur pour lire les lignes à partir de filepath.
  • Combinez les résultats à l'aide d'une fonction appropriée pour créer un cadre de données.
  • Indiquez l'opérateur parallèle.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

cl <- makeCluster(4)
registerDoParallel(cl)
# Use an iterator to read lines
foreach(l = ___,
        # Combine the lines as rows
        ___ = ___
        # Use the parallel operator
        ) ___ {
  line <- strsplit(l, ",")[[1]]
  if (line[4] == "Australia") {
    return(line)
  }
}

stopCluster(cl)
Modifier et exécuter le code