or
यह अभ्यास पाठ्यक्रम का हिस्सा है
समाचार लेखों को वर्गीकृत करने के लिए तैयार होने से पहले, क्लस्टरिंग की बुनियादी बातें जानना ज़रूरी है। यह अध्याय आपको मशीन लर्निंग की एक श्रेणी, जिसे अनसुपरवाइज़्ड लर्निंग कहते हैं, से परिचित कराता है और फिर क्लस्टरिंग से, जो एक लोकप्रिय अनसुपरवाइज़्ड लर्निंग एल्गोरिदम है। आप दो लोकप्रिय क्लस्टरिंग तकनीकों — हाइयरार्किकल क्लस्टरिंग और k-means क्लस्टरिंग — के बारे में जानेंगे। अध्याय का समापन क्लस्टरिंग शुरू करने से पहले किए जाने वाले बेसिक प्री-प्रोसेसिंग स्टेप्स से होता है।
यह अध्याय एक लोकप्रिय क्लस्टरिंग एल्गोरिदम — हाइयरार्किकल क्लस्टरिंग — और SciPy में उसकी इम्प्लीमेंटेशन पर केंद्रित है। हाइयरार्किकल क्लस्टरिंग करने की प्रक्रिया के अलावा, यह आपको एक महत्वपूर्ण सवाल का जवाब ढूँढने में मदद करने की कोशिश करता है — आपके डेटा में कितने क्लस्टर्स मौजूद हैं? अध्याय का समापन हाइयरार्किकल क्लस्टरिंग की सीमाओं पर चर्चा और इसे उपयोग करते समय ध्यान देने योग्य बातों के साथ होता है।
यह अध्याय एक अलग क्लस्टरिंग एल्गोरिदम — k-means क्लस्टरिंग — और SciPy में उसकी इम्प्लीमेंटेशन से परिचित कराता है। k-means क्लस्टरिंग, पिछले अध्याय में बताई गई हाइयरार्किकल क्लस्टरिंग की सबसे बड़ी कमी को दूर करती है। चूँकि डेंड्रोग्राम विशेष रूप से हाइयरार्किकल क्लस्टरिंग से जुड़े होते हैं, यह अध्याय k-means चलाने से पहले क्लस्टर्स की संख्या पता करने की एक विधि पर चर्चा करता है। अध्याय का समापन k-means क्लस्टरिंग की सीमाओं और इस एल्गोरिदम का उपयोग करते समय ध्यान देने योग्य बातों पर चर्चा के साथ होता है।
अब जब आप दो सबसे लोकप्रिय क्लस्टरिंग तकनीकों से परिचित हैं, यह अध्याय आपको इन्हें वास्तविक समस्याओं पर लागू करने में मदद करता है। अध्याय पहले किसी इमेज में डॉमिनेंट रंग खोजने की प्रक्रिया पर चर्चा करता है, और फिर परिचय में बताए गए मुद्दे — समाचार लेखों की क्लस्टरिंग — पर आगे बढ़ता है। अध्याय का समापन मल्टीपल वेरिएबल्स के साथ क्लस्टरिंग पर चर्चा से होता है, जिससे सारा डेटा विज़ुअलाइज़ करना कठिन हो जाता है।
वर्तमान अभ्यास