Mulai sekarangMulai gratis

Tontonan ganda popcorn

Metode dplyr yang Anda lihat pada dua bab sebelumnya menggunakan antarmuka SQL milik Spark. Artinya, kode R Anda diubah menjadi kode SQL sebelum diteruskan ke Spark. Ini merupakan solusi yang sangat baik untuk manipulasi data dasar, tetapi akan menemui kendala saat Anda ingin melakukan pemrosesan yang lebih rumit. Misalnya, Anda dapat menghitung mean dari sebuah kolom, tetapi tidak median. Berikut adalah contoh dari latihan 'Meringkas kolom' yang Anda selesaikan di Bab 1.

track_metadata_tbl %>%
  summarize(mean_duration = mean(duration)) #OK
track_metadata_tbl %>%
  summarize(median_duration = median(duration))

sparklyr juga memiliki dua antarmuka "native" yang akan dibahas pada dua bab berikutnya. Native berarti bahwa antarmuka tersebut memanggil kode Java atau Scala untuk mengakses pustaka Spark secara langsung, tanpa konversi ke SQL. sparklyr mendukung Spark DataFrame Application Programming Interface (API), dengan fungsi yang berawalan sdf_. sparklyr juga mendukung akses ke pustaka machine learning Spark, MLlib, dengan fungsi "feature transformation" yang diawali ft_, dan fungsi "machine learning" yang diawali ml_.

Satu perbedaan filosofis yang penting antara bekerja dengan R dan bekerja dengan Spark adalah Spark jauh lebih ketat terhadap tipe variabel dibandingkan R. Sebagian besar fungsi native menginginkan masukan DoubleType dan mengembalikan keluaran DoubleType. DoubleType adalah padanan tipe vektor numeric di R dalam Spark. sparklyr akan menangani konversi numeric ke DoubleType, tetapi pengguna (yaitu Anda!) yang bertanggung jawab mengonversi data logical atau integer menjadi data numeric dan sebaliknya.

Manakah pernyataan berikut yang benar?

  1. Metode dplyr milik sparklyr mengonversi kode menjadi kode Scala sebelum menjalankannya di Spark.
  2. Mengonversi kode R menjadi kode SQL membatasi jumlah komputasi yang didukung.
  3. Sebagian besar fungsi pemodelan Spark MLlib memerlukan masukan DoubleType dan menghasilkan keluaran DoubleType.
  4. Sebagian besar fungsi pemodelan Spark MLlib memerlukan masukan IntegerType dan menghasilkan keluaran BooleanType.

Latihan ini merupakan bagian dari kursus

Pengantar Spark dengan sparklyr di R

Lihat Kursus

Latihan interaktif langsung

Ubah teori menjadi aksi dengan salah satu latihan interaktif kami

Mulai latihan