or
Den här övningen är en del av kursen
Innan du kan klassificera nyhetsartiklar behöver du lära dig grunderna i klustring. Det här kapitlet introducerar dig till en klass av maskininlärningsalgoritmer som kallas oövervakad inlärning och presenterar sedan klustring, en av de mest populära algoritmerna inom detta område. Du får lära dig om två vanliga klustringsmetoder – hierarkisk klustring och k-means-klustring. Kapitlet avslutas med grundläggande förbehandlingssteg inför klustring av data.
Det här kapitlet fokuserar på en populär klustringsalgoritm – hierarkisk klustring – och dess implementering i SciPy. Utöver hur du utför hierarkisk klustring behandlas också en viktig fråga: hur många kluster finns det i din data? Kapitlet avslutas med en diskussion om begränsningarna hos hierarkisk klustring och vad du bör tänka på när du använder metoden.
Det här kapitlet introducerar en annan klustringsalgoritm – k-means-klustring – och dess implementering i SciPy. K-means-klustring löser den största nackdelen med hierarkisk klustring som diskuterades i föregående kapitel. Eftersom dendogram är specifika för hierarkisk klustring tar det här kapitlet upp en metod för att bestämma antalet kluster innan du kör k-means-klustring. Kapitlet avslutas med en diskussion om begränsningarna hos k-means-klustring och vad du bör tänka på när du använder algoritmen.
Nu när du är bekant med två av de mest populära klustringsmetoderna hjälper det här kapitlet dig att tillämpa dessa kunskaper på verkliga problem. Kapitlet börjar med att diskutera hur du hittar dominerande färger i en bild och övergår sedan till problemet som introducerades i kursen – klustring av nyhetsartiklar. Kapitlet avslutas med en diskussion om klustring med flera variabler, vilket gör det svårare att visualisera all data.
Aktuell övning