Modelování datasetu UFO, část 1
V tomto cvičení sestavíš model k nejbližších sousedů, který bude předpovídat, ve které zemi bylo pozorování UFO zaznamenáno. Dataset X obsahuje log-normalizovaný sloupec se sekundami, one-hot enkódované sloupce s typy pozorování a také měsíc a rok, kdy k pozorování došlo. Štítky y představují enkódovaný sloupec země, kde 1 odpovídá "us" a 0 odpovídá "ca".
Toto cvičení je součástí kurzu
Preprocessing pro Machine Learning v Pythonu
Pokyny k cvičení
- Vypiš
.columnsdatasetuX. - Rozděl datasety
Xaytak, aby rozložení tříd štítků bylo stejné v trénovací i testovací sadě, a použijrandom_states hodnotou42. - Natrénuj model
knnna trénovacích datech. - Vypiš přesnost modelu
knnna testovací sadě.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Take a look at the features in the X set of data
print(____)
# Split the X and y sets
X_train, X_test, y_train, y_test = ____
# Fit knn to the training sets
knn.____
# Print the score of knn on the test sets
print(____)