एक-दूसरे के लिए बने
R आपको डेटा विश्लेषण का कोड जल्दी लिखने देता है. थोड़ी सावधानी के साथ, आप अपना कोड पढ़ने में आसान भी बना सकते हैं, जिससे उसका रखरखाव करना भी आसान हो जाता है. कई स्थितियों में, आपका कोड चलाने में R पर्याप्त तेज़ भी होता है.
दुर्भाग्य से, R यह मानता है कि आपका सारा डेटा एक ही मशीन की मेमोरी (RAM) में विश्लेषित हो. इससे R के जरिए आप जितना डेटा विश्लेषित कर सकते हैं, वह सीमित हो जाता है. इस समस्या के कुछ समाधान हैं, जिनमें Spark का उपयोग भी शामिल है.
Spark एक ओपन सोर्स क्लस्टर कंप्यूटिंग प्लेटफ़ॉर्म है. इसका मतलब है कि आप अपना डेटा और अपनी गणनाएँ कई मशीनों में बाँट सकते हैं, जिससे आप वस्तुतः असीमित मात्रा में डेटा का विश्लेषण कर सकते हैं. ये दोनों तकनीकें एक-दूसरे को बेहतरीन तरीके से पूरक करती हैं. R और Spark को साथ इस्तेमाल करके आप कोड तेज़ी से लिख सकते हैं और तेज़ी से चला भी सकते हैं!
sparklyr एक R पैकेज है जो आपको Spark क्लस्टर में डेटा के साथ काम करने के लिए R कोड लिखने देता है. इसमें dplyr इंटरफ़ेस है, यानी आप (लगभग) वही dplyr-स्टाइल R कोड लिख सकते हैं, चाहे आप अपने लोकल मशीन के डेटा पर काम कर रहे हों या Spark क्लस्टर पर.
अगर आप और तेज़ जाना चाहते हैं तो ज़ोर से चीखिए!
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
इंटरैक्टिव व्यावहारिक अभ्यास
हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें
अभ्यास शुरू करें