НачатьНачать бесплатно

Чтение необработанных данных и преобразование в структуру данных

Как уже упоминалось, одна из причин высокой производительности iotools — разделение двух операций: чтения данных с жёсткого диска и преобразования двоичных данных в data.frame или matrix. Данные в двоичном формате копируются с диска в память как объекты типа raw, которые затем передаются в оптимизированные функции для преобразования в data.frame или matrix.

В этом упражнении вы научитесь разделять чтение данных с диска (с помощью функции readAsRaw()) и преобразование двоичных данных типа raw в matrix или data.frame (с помощью функций mstrsplit() и dstrsplit()).

Это упражнение является частью курса

Масштабируемая обработка данных в R

Посмотреть курс

Инструкции к упражнению

  • Считайте файл "mortgage-sample.csv" как вектор типа raw.
  • Преобразуйте содержимое вектора типа raw в matrix из целых чисел.
  • Преобразуйте содержимое вектора типа raw в data.frame с 16 столбцами целых чисел.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Read mortgage-sample.csv as a raw vector
raw_file_content <- ___("mortgage-sample.csv")

# Convert the raw vector contents to a matrix
mort_mat <- ___(___, sep = ",", type = ___, skip = 1)

# Look at the first 6 rows
head(mort_mat)

# Convert the raw file contents to a data.frame
mort_df <- ___(___, sep = ",", col_types = rep("integer", 16), skip = 1)

# Look at the first 6 rows
head(mort_df)
Редактировать и запускать код