Чтение необработанных данных и преобразование в структуру данных
Как уже упоминалось, одна из причин высокой производительности iotools — разделение двух операций: чтения данных с жёсткого диска и преобразования двоичных данных в data.frame или matrix. Данные в двоичном формате копируются с диска в память как объекты типа raw, которые затем передаются в оптимизированные функции для преобразования в data.frame или matrix.
В этом упражнении вы научитесь разделять чтение данных с диска (с помощью функции readAsRaw()) и преобразование двоичных данных типа raw в matrix или data.frame (с помощью функций mstrsplit() и dstrsplit()).
Это упражнение является частью курса
Масштабируемая обработка данных в R
Инструкции к упражнению
- Считайте файл
"mortgage-sample.csv"как вектор типаraw. - Преобразуйте содержимое вектора типа
rawвmatrixиз целых чисел. - Преобразуйте содержимое вектора типа
rawвdata.frameс 16 столбцами целых чисел.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Read mortgage-sample.csv as a raw vector
raw_file_content <- ___("mortgage-sample.csv")
# Convert the raw vector contents to a matrix
mort_mat <- ___(___, sep = ",", type = ___, skip = 1)
# Look at the first 6 rows
head(mort_mat)
# Convert the raw file contents to a data.frame
mort_df <- ___(___, sep = ",", col_types = rep("integer", 16), skip = 1)
# Look at the first 6 rows
head(mort_df)