ÎncepețiÎncepe gratuit

Determină numărul optim de clustere

Aici vei folosi metoda cotului (elbow criterion) pentru a identifica numărul optim de clustere, acolo unde scăderea sumei pătratelor erorilor devine marginală. Acesta este un pas important pentru a obține o estimare matematică a numărului de clustere de la care să începi testarea. Vei itera prin mai multe valori k ale numărului de clustere, vei rula algoritmul KMeans pentru fiecare valoare, apoi vei reprezenta grafic erorile în funcție de fiecare k pentru a identifica „cotul" unde scăderea erorilor încetinește.

Modulul KMeans este importat din sklearn.cluster, biblioteca seaborn este încărcată ca sns, iar modulul matplotlib.pyplot este încărcat ca plt. De asemenea, setul de date scalat este disponibil ca wholesale_scaled_df, un DataFrame pandas.

Acest exercițiu face parte din cursul

Machine Learning pentru Marketing în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un dicționar gol sse.
  • Antrenează un algoritm KMeans pentru valori k între 1 și 11 și stochează erorile în dicționarul sse.
  • Adaugă titlul graficului.
  • Creează un scatter plot cu cheile pe axa X și valorile pe axa Y și afișează graficul.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create empty sse dictionary
sse = {}

# Fit KMeans algorithm on k values between 1 and 11
for k in ___(1, 11):
    kmeans = ___(n_clusters=___, random_state=333)
    kmeans.___(wholesale_scaled_df)
    sse[k] = kmeans.inertia_

# Add the title to the plot
plt.___('Elbow criterion method chart')

# Create and display a scatter plot
sns.pointplot(x=list(sse.___()), y=list(sse.___()))
plt.___()
Editează și rulează codul