ПочатиПочніть безкоштовно

Ітерування та фільтрування

Як консультанти з даних, ви отримуєте дані у найрізноманітніших форматах. Клієнт щойно передав 40-гігабайтовий файл CSV із даними про заклади вищої освіти по всьому світу.

Молодші аналітики не можуть коректно розібрати дані через нестачу пам'яті, а бюджету на обчислювальні ресурси для обробки всього набору даних немає. Вашій поточній роботі потрібен аналіз лише інститутів в Австралії. Шлях до CSV уже збережено у змінній filepath. Вас попросили реалізувати ефективний зчитувач для цих даних. Пакети parallel, doParallel, foreach і iterators уже завантажено.

Ця вправа є частиною курсу

Паралельне програмування в R

Переглянути курс

Інструкції до вправи

  • Використайте ітератор, щоб зчитувати рядки з filepath.
  • Об'єднайте результати за допомогою відповідної функції, щоб створити датафрейм.
  • Вкажіть паралельний оператор.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

cl <- makeCluster(4)
registerDoParallel(cl)
# Use an iterator to read lines
foreach(l = ___,
        # Combine the lines as rows
        ___ = ___
        # Use the parallel operator
        ) ___ {
  line <- strsplit(l, ",")[[1]]
  if (line[4] == "Australia") {
    return(line)
  }
}

stopCluster(cl)
Редагувати та запускати код