Filter- och wrapper-metoder
Frågor om att minska dimensionaliteten hos en datamängd är mycket vanliga i maskininlärningsintervjuer. Ett sätt att minska dimensionaliteten är att bara välja relevanta särdrag i din datamängd.
Här får du öva på en filtermetod på diabetes-DataFramen, följt av 2 olika typer av wrapper-metoder med korsvalidering. Du använder pandas, matplotlib.pyplot och seaborn för att visualisera korrelationer, bearbeta din data och tillämpa tekniker för särdragsurval.
Särdragsmatrisen med målvariabelkolumnen (progression) borttagen är laddad som X, medan målvariabeln är laddad som y.
Observera att pandas, matplotlib.pyplot och seaborn redan har importerats till din arbetsyta och fått aliasen pd, plt respektive sns.
Lägg märke till att du har lagt till ett korsvaliderings-steg i din pipeline (som gäller de tre sista stegen):

Den här övningen är en del av kursen
Öva på maskininlärningsintervjufrågor i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create correlation matrix and print it
cor = ____.____()
print(____)
# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()
# Correlation with output variable
cor_target = abs(cor["progression"])
# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)