Wczytywanie surowych danych i przekształcanie ich w strukturę danych
Jak już wspomniano, jednym z powodów, dla których iotools działa tak szybko, jest rozdzielenie wczytywania danych z dysku od konwertowania danych binarnych na data.frame lub matrix. Dane w formacie binarnym są kopiowane z dysku do pamięci jako obiekty raw. Następnie te obiekty raw są przekazywane do zoptymalizowanych funkcji, które zamieniają je w obiekty data.frame lub matrix.
W tym ćwiczeniu nauczysz się rozdzielać wczytywanie danych z dysku (za pomocą funkcji readAsRaw()) od konwertowania surowych danych binarnych na matrix lub data.frame (za pomocą funkcji mstrsplit() i dstrsplit()).
To ćwiczenie jest częścią kursu
Skalowalne przetwarzanie danych w R
Instrukcje do ćwiczenia
- Wczytaj plik
"mortgage-sample.csv"jako surowy wektor. - Przekonwertuj zawartość surowego wektora na
matrixliczb całkowitych. - Przekonwertuj zawartość surowego wektora na
data.framez 16 kolumnami całkowitoliczbowymi.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Read mortgage-sample.csv as a raw vector
raw_file_content <- ___("mortgage-sample.csv")
# Convert the raw vector contents to a matrix
mort_mat <- ___(___, sep = ",", type = ___, skip = 1)
# Look at the first 6 rows
head(mort_mat)
# Convert the raw file contents to a data.frame
mort_df <- ___(___, sep = ",", col_types = rep("integer", 16), skip = 1)
# Look at the first 6 rows
head(mort_df)