Generera datamängder för klassificering
Det kan vara svårt att hitta en verklig datamängd som uppfyller alla önskade kombinationer av kriterier – och om en sådan samlas in kan den dessutom väcka integritetsfrågor. En lösning är att använda datamängdsgeneratorer, som ger goda approximationer av verkliga datamängder.
I den här övningen skapar du en stor datamängd för ett klassificeringsproblem med 3 klasser. För enkel visualisering av den genererade datamängden som ett spridningsdiagram finns en anpassad funktion tillgänglig som plot_data_points().
Den här övningen är en del av kursen
Dataintegritet och anonymisering i Python
Övningsinstruktioner
- Importera motsvarande funktion från
sklearn.datasetsför att generera klassificeringsdatamängder. - Generera
5000sampel med4särdrag,1kluster per klass,3klasser och en klasseparation på2. - Skriv ut formen på den genererade datamängden.
- Studera det resulterande spridningsdiagrammet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the function for generating classification datasets
from sklearn.datasets import ____
# Generate 5000 samples with 4 features, 1 cluster per class, 3 classes, and class separation of 2
x, y = ____
# Inspect the generated data shape
print(____)
# Inspect the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, y)