Ітерування та фільтрування
Як консультанти з даних, ви отримуєте дані у найрізноманітніших форматах. Клієнт щойно передав 40-гігабайтовий файл CSV із даними про заклади вищої освіти по всьому світу.
Молодші аналітики не можуть коректно розібрати дані через нестачу пам'яті, а бюджету на обчислювальні ресурси для обробки всього набору даних немає. Вашій поточній роботі потрібен аналіз лише інститутів в Австралії. Шлях до CSV уже збережено у змінній filepath. Вас попросили реалізувати ефективний зчитувач для цих даних. Пакети parallel, doParallel, foreach і iterators уже завантажено.
Ця вправа є частиною курсу
Паралельне програмування в R
Інструкції до вправи
- Використайте ітератор, щоб зчитувати рядки з
filepath. - Об'єднайте результати за допомогою відповідної функції, щоб створити датафрейм.
- Вкажіть паралельний оператор.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
cl <- makeCluster(4)
registerDoParallel(cl)
# Use an iterator to read lines
foreach(l = ___,
# Combine the lines as rows
___ = ___
# Use the parallel operator
) ___ {
line <- strsplit(l, ",")[[1]]
if (line[4] == "Australia") {
return(line)
}
}
stopCluster(cl)