Birbirleri için yaratılmış
R, veri analizi kodunu hızlıca yazmana olanak tanır. Biraz özenle kodunu okunaklı da yapabilir, böylece kodunu kolayca sürdürebilirsin. Pek çok durumda R, kodunu çalıştırma konusunda da yeterince hızlıdır.
Ne yazık ki R, tüm verinin tek bir makinede bellekte (RAM) analiz edilmesini gerektirir. Bu da R ile analiz edebileceğin veri miktarını sınırlar. Bu soruna Spark kullanımı da dahil olmak üzere birkaç çözüm var.
Spark, açık kaynaklı bir küme (cluster) hesaplama platformudur. Bu, verini ve hesaplamalarını birden fazla makineye yayabileceğin anlamına gelir; böylece pratikte sınırsız miktarda veriyi analiz edebilirsin. Bu iki teknoloji birbirini çok iyi tamamlar. R ve Spark’ı birlikte kullanarak hem kodu hızlı yazıp hem de hızlı çalıştırabilirsin!
sparklyr, bir Spark kümesindeki verilerle çalışmak için R kodu yazmana olanak sağlayan bir R paketidir. dplyr arayüzüne sahiptir; yani verilerle ister kendi makinen üzerinde ister bir Spark kümesinde çalışıyor ol, (aşağı yukarı) aynı dplyr tarzı R kodunu yazabilirsin.
Daha hızlı gitmek istiyorsan bağır!
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Uygulamalı etkileşimli egzersiz
Teoriyi etkileşime dönüştürün, interaktif egzersizlerimizden biriyle
Egzersize başla