Iterera och filtrera
Som datakonsult tar du emot data i alla möjliga format och storlekar. En kund har precis överfört en 40 gigabyte stor CSV-fil med data om högre utbildningsinstitutioner runt om i världen.
De juniora analytikerna kan inte tolka datan korrekt på grund av minnesbrist, och det finns ingen budget för de beräkningsresurser som krävs för att hantera hela datamängden. Din nuvarande analys kräver bara data om institutioner i Australien. Filsökvägen till CSV-filen är redan lagrad i variabeln filepath. Du har blivit ombedd att implementera en effektiv inläsare för dessa data. Paketen parallel, doParallel, foreach och iterators har redan laddats in åt dig.
Den här övningen är en del av kursen
Parallell programmering i R
Övningsinstruktioner
- Använd en iterator för att läsa rader från
filepath. - Kombinera resultaten med en lämplig funktion för att skapa en dataram.
- Ange den parallella operatorn.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
cl <- makeCluster(4)
registerDoParallel(cl)
# Use an iterator to read lines
foreach(l = ___,
# Combine the lines as rows
___ = ___
# Use the parallel operator
) ___ {
line <- strsplit(l, ",")[[1]]
if (line[4] == "Australia") {
return(line)
}
}
stopCluster(cl)