Analýza hlavních komponent
V posledních 2 kapitolách jsi viděl/a různé způsoby, jak snížit dimenzionalitu datasetu – včetně regularizace a výběru příznaků. Schopnost vysvětlit různé přístupy ke snižování dimenzionality je důležitou součástí každého ML pohovoru. Velké datasety jsou výpočetně náročné a šum v datech může zkreslit výsledky.
Jednou z metod snižování dimenzionality je analýza hlavních komponent (PCA). Jde o účinný způsob, jak zmenšit objem dat tím, že se vytvoří nové příznaky zachycující nejdůležitější informace v datasetu a zároveň odstraňující multikolinearitu. V tomto cvičení použiješ modul sklearn.decomposition k provedení PCA na příznacích datasetu diabetes a zároveň izoluješ cílovou proměnnou progression.
Tady se v pipeline právě nacházíš:

Toto cvičení je součástí kurzu
Procvičování otázek k pohovorům z oblasti Machine Learning v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import module
from ____.____ import ____
# Feature matrix and target array
X = ____.____('____', axis=1)
y = ____['____']