Histogram से KDE
इन अभ्यासों में, हम अपने डेटा के उस सबसेट को देखेंगे जिसमें "Heavy Duty Truck" को जारी किए गए citations शामिल हैं। मान लीजिए आप डेटा-समझ रखने वाले ट्रक ड्राइवर हैं और जानना चाहते हैं कि सड़क पर निकलने का सबसे खतरनाक समय कब है। ध्यान दें कि यहाँ सैंपल साइज़ सिर्फ 32 observations है.
नीचे ggplot से एक डिफ़ॉल्ट histogram बनाने का कोड दिया है। यह आश्चर्यजनक नहीं है कि यह बहुत अच्छा नहीं है। डेटा इतना नहीं है कि 30 bins भी भर सकें, जिससे चार्ट पढ़ना और डेटा को समझना कठिन हो जाता है। ज्योमेट्री को geom_density() का उपयोग करके KDE में बदलें। अंत में, अपनी visualization को यथासंभव पारदर्शी रखने के लिए, प्लॉट में एक subtitle जोड़ें जो दर्शक को आपके KDE के लिए इस्तेमाल किए गए bin-width के बारे में बताए।
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Visualization की Best Practices
अभ्यास निर्देश
- Histogram की geometry को density में बदलें (
geom_density()). - डिफ़ॉल्ट bin width को
1.5units में संशोधित करें. - अपने प्लॉट में
subtitle"Gaussian kernel SD = 1.5"जोड़ें, ताकि पाठक को आपके kernel का binwidth पता चले.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# filter data to just heavy duty trucks
truck_speeding <- md_speeding %>%
filter(vehicle_type == "Heavy Duty Truck")
ggplot(truck_speeding, aes(x = hour_of_day)) +
# switch to density with bin width of 1.5, keep fill
geom_histogram(fill = 'steelblue') +
# add a subtitle stating binwidth
labs(title = 'Citations by hour')