शुरू करेंमुफ़्त में शुरू करें

डेटा साइज़ के साथ प्रोसेसिंग समय कैसे बदलता है?

यदि आप दो डेटासेट के सभी एलिमेंट प्रोसेस कर रहे हैं और उनमें से एक बड़ा है, तो बड़ा डेटासेट प्रोसेस करने में अधिक समय लेगा. लेकिन यह समझना ज़रूरी है कि यह कितना अधिक समय लेगा, यह हमेशा उसके आकार में वृद्धि के अनुपात में नहीं होता. यानी, अगर आपके पास दो डेटासेट हैं और एक दूसरे से दो गुना बड़ा है, तो यह सुनिश्चित नहीं है कि बड़े वाले को प्रोसेस करने में दोगुना समय लगेगा. यह 1.5 गुना भी हो सकता है या चार गुना भी. यह इस पर निर्भर करता है कि डेटा को प्रोसेस करने के लिए कौन-सी ऑपरेशंस इस्तेमाल की गई हैं.

इस अभ्यास में, आप microbenchmark पैकेज का इस्तेमाल करेंगे, जिसे Writing Efficient R Code course में कवर किया गया था.

नोट: संख्याएँ वैज्ञानिक संकेतन में दी गई हैं $$1e5 = 1 * 10^5 = 100,000$$

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Scalable Data Processing

पाठ्यक्रम देखें

अभ्यास निर्देश

  • microbenchmark पैकेज लोड करें.
  • रैंडम वेक्टर के sort समय की तुलना करने के लिए microbenchmark() फंक्शन का उपयोग करें.
  • mb पर plot() कॉल करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load the microbenchmark package
___

# Compare the timings for sorting different sizes of vector
mb <- ___(
  # Sort a random normal vector length 1e5
  "1e5" = sort(rnorm(1e5)),
  # Sort a random normal vector length 2.5e5
  "2.5e5" = sort(rnorm(2.5e5)),
  # Sort a random normal vector length 5e5
  "5e5" = sort(rnorm(5e5)),
  "7.5e5" = sort(rnorm(7.5e5)),
  "1e6" = sort(rnorm(1e6)),
  times = 10
)

# Plot the resulting benchmark object
___(mb)
कोड संपादित करें और चलाएँ