Kom igångKom igång gratis

Iterera och filtrera

Som datakonsult tar du emot data i alla möjliga format och storlekar. En kund har precis överfört en 40 gigabyte stor CSV-fil med data om högre utbildningsinstitutioner runt om i världen.

De juniora analytikerna kan inte tolka datan korrekt på grund av minnesbrist, och det finns ingen budget för de beräkningsresurser som krävs för att hantera hela datamängden. Din nuvarande analys kräver bara data om institutioner i Australien. Filsökvägen till CSV-filen är redan lagrad i variabeln filepath. Du har blivit ombedd att implementera en effektiv inläsare för dessa data. Paketen parallel, doParallel, foreach och iterators har redan laddats in åt dig.

Den här övningen är en del av kursen

Parallell programmering i R

Visa kurs

Övningsinstruktioner

  • Använd en iterator för att läsa rader från filepath.
  • Kombinera resultaten med en lämplig funktion för att skapa en dataram.
  • Ange den parallella operatorn.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

cl <- makeCluster(4)
registerDoParallel(cl)
# Use an iterator to read lines
foreach(l = ___,
        # Combine the lines as rows
        ___ = ___
        # Use the parallel operator
        ) ___ {
  line <- strsplit(l, ",")[[1]]
  if (line[4] == "Australia") {
    return(line)
  }
}

stopCluster(cl)
Redigera och kör kod