Kom igångKom igång gratis

Generera datamängder för klassificering

Det kan vara svårt att hitta en verklig datamängd som uppfyller alla önskade kombinationer av kriterier – och om en sådan samlas in kan den dessutom väcka integritetsfrågor. En lösning är att använda datamängdsgeneratorer, som ger goda approximationer av verkliga datamängder.

I den här övningen skapar du en stor datamängd för ett klassificeringsproblem med 3 klasser. För enkel visualisering av den genererade datamängden som ett spridningsdiagram finns en anpassad funktion tillgänglig som plot_data_points().

Den här övningen är en del av kursen

Dataintegritet och anonymisering i Python

Visa kurs

Övningsinstruktioner

  • Importera motsvarande funktion från sklearn.datasets för att generera klassificeringsdatamängder.
  • Generera 5000 sampel med 4 särdrag, 1 kluster per klass, 3 klasser och en klasseparation på 2.
  • Skriv ut formen på den genererade datamängden.
  • Studera det resulterande spridningsdiagrammet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the function for generating classification datasets
from sklearn.datasets import ____

# Generate 5000 samples with 4 features, 1 cluster per class, 3 classes, and class separation of 2
x, y = ____

# Inspect the generated data shape
print(____)

# Inspect the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, y)
Redigera och kör kod