आख़िर Spark है क्या?
Spark एक क्लस्टर कंप्यूटिंग प्लेटफ़ॉर्म है. Spark आपको डेटा और computations को कई nodes वाले clusters में फैलाने देता है (हर node को एक अलग कंप्यूटर की तरह समझिए). जब आप अपने डेटा को बाँट देते हैं, तो बहुत बड़े datasets पर काम करना आसान हो जाता है, क्योंकि हर node केवल थोड़े से डेटा पर काम करता है.
जब हर node कुल डेटा के अपने हिस्से पर काम करता है, तो वह कुल गणना का अपना हिस्सा भी पूरा करता है. इस तरह क्लस्टर के nodes पर data processing और computation दोनों ही कार्य parallel में होते हैं. यह तथ्य है कि parallel computation कुछ तरह के प्रोग्रामिंग कार्यों को काफ़ी तेज़ बना सकता है.
लेकिन, अधिक computing power के साथ जटिलता भी बढ़ती है.
यह तय करना कि आपकी समस्या के लिए Spark सबसे अच्छा समाधान है या नहीं, अनुभव माँगता है. फिर भी, आप इन सवालों पर विचार कर सकते हैं:
- क्या मेरा डेटा एक ही मशीन पर काम करने के लिए बहुत बड़ा है?
- क्या मेरी गणनाएँ आसानी से parallel की जा सकती हैं?
क्या आप Spark के बारे में और सीखने के लिए उत्साहित हैं?
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark की नींव
इंटरैक्टिव व्यावहारिक अभ्यास
हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें
अभ्यास शुरू करें