Iterace a filtrování
Jako datový konzultant dostáváš data v nejrůznějších podobách a formátech. Klient právě přenesl 40gigabajtový CSV soubor s daty o vysokoškolských institucích z celého světa.
Mladší analytici nejsou schopni data správně načíst kvůli nedostatku paměti a není rozpočet na výpočetní zdroje potřebné ke zpracování celé datové sady. Pro aktuální analýzu potřebuješ pouze data o institucích v Austrálii. Cesta k CSV souboru je už uložená v proměnné filepath. Tvým úkolem je implementovat efektivní čtečku těchto dat. Balíčky parallel, doParallel, foreach a iterators jsou již načteny.
Toto cvičení je součástí kurzu
Paralelní programování v R
Pokyny k cvičení
- Použij iterátor pro čtení řádků ze souboru
filepath. - Výsledky spoj pomocí vhodné funkce tak, aby vznikl datový rámec.
- Zadej paralelní operátor.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
cl <- makeCluster(4)
registerDoParallel(cl)
# Use an iterator to read lines
foreach(l = ___,
# Combine the lines as rows
___ = ___
# Use the parallel operator
) ___ {
line <- strsplit(l, ",")[[1]]
if (line[4] == "Australia") {
return(line)
}
}
stopCluster(cl)