Kom igångKom igång gratis

Filter- och wrapper-metoder

Frågor om att minska dimensionaliteten hos en datamängd är mycket vanliga i maskininlärningsintervjuer. Ett sätt att minska dimensionaliteten är att bara välja relevanta särdrag i din datamängd.

Här får du öva på en filtermetod på diabetes-DataFramen, följt av 2 olika typer av wrapper-metoder med korsvalidering. Du använder pandas, matplotlib.pyplot och seaborn för att visualisera korrelationer, bearbeta din data och tillämpa tekniker för särdragsurval.

Särdragsmatrisen med målvariabelkolumnen (progression) borttagen är laddad som X, medan målvariabeln är laddad som y.

Observera att pandas, matplotlib.pyplot och seaborn redan har importerats till din arbetsyta och fått aliasen pd, plt respektive sns.

Lägg märke till att du har lagt till ett korsvaliderings-steg i din pipeline (som gäller de tre sista stegen):

Machine learning pipeline

Den här övningen är en del av kursen

Öva på maskininlärningsintervjufrågor i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
Redigera och kör kod