Začněte nyníZačněte zdarma

Rozdělení dat na trénovací a testovací sadu

Teď jsi připraven/a sestavit kompletní model strojového učení pomocí několika jednoduchých kroků! Podrobnostem modelování se budeme věnovat v dalších kapitolách, ale zatím si procvičíš a pochopíš ty nejdůležitější z nich.

Nezávislé příznaky jsou načteny jako pandas DataFrame s názvem X a závislé hodnoty jako pandas Series s názvem Y.

Funkce train_test_split je již načtena z knihovny sklearn. Vytvoříš trénovací a testovací datové sady a ověříš, že data byla správně rozdělena.

Toto cvičení je součástí kurzu

Machine Learning for Marketing in Python

Zobrazit kurz

Pokyny k cvičení

  • Rozděl X a Y na trénovací a testovací sadu tak, aby 25 % dat připadlo na testování.
  • Ověř, že trénovací sada obsahuje přesně 75 % původních dat.
  • Ověř, že testovací sada obsahuje přesně 25 % původních dat.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)

# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])

# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])
Upravit a spustit kód