ओवरप्लॉटिंग 1: बड़े डेटासेट
स्कैटर प्लॉट (geom_point()) सहज, आसानी से समझ में आने वाले, और बहुत सामान्य होते हैं, लेकिन हमें ओवरप्लॉटिंग को हमेशा ध्यान में रखना चाहिए, खासकर इन चार स्थितियों में:
- बड़े डेटासेट
- एक ही अक्ष पर संरेखित मान
- कम-सटीकता वाला डेटा
- पूर्णांक (integer) डेटा
आम तौर पर, ठोस शेप्स के साथ alpha ब्लेंडिंग (यानी ट्रांसपेरेंसी जोड़ना) की सिफारिश की जाती है। वैकल्पिक रूप से, आप अपारदर्शी, खोखले शेप्स का उपयोग कर सकते हैं।
उच्च घनत्व वाले क्षेत्रों (बहुत अधिक ओवरलैप) के साथ बड़े डेटासेट के लिए छोटे पॉइंट उपयुक्त होते हैं।
आइए बड़े डेटासेट वाले मामले से निपटने का अभ्यास करने के लिए diamonds डेटासेट का उपयोग करें।
यह अभ्यास पाठ्यक्रम का हिस्सा है
ggplot2 के साथ डेटा विज़ुअलाइज़ेशन परिचय
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Plot price vs. carat, colored by clarity
plt_price_vs_carat_by_clarity <- ggplot(diamonds, aes(carat, price, color = clarity))
# Add a point layer with tiny points
plt_price_vs_carat_by_clarity + ___