Kom igångKom igång gratis

Binarisering av kolumner

Numeriska värden kan ofta användas direkt utan feature engineering, men ibland kan någon form av bearbetning vara användbar. I vissa situationer spelar storleken på ett värde ingen roll – det enda som är intressant är dess riktning, eller om det överhuvudtaget existerar. I sådana fall är det lämpligt att binarisera en kolumn. I datamängden so_survey_df finns ett stort antal respondenter som arbetar frivilligt, det vill säga utan lön. Du ska skapa en ny kolumn med namnet Paid_Job som anger om varje person är avlönad (det vill säga om lönen är större än noll).

Den här övningen är en del av kursen

Särdragshantering för maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Skapa en ny kolumn med namnet Paid_Job fylld med nollor.
  • Ersätt alla värden i Paid_Job med 1 där motsvarande värde i ConvertedSalary är större än 0.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create the Paid_Job column filled with zeros
so_survey_df[____] = ____

# Replace all the Paid_Job values where ConvertedSalary is > 0
so_survey_df.____[____, 'Paid_Job'] = 1

# Print the first five rows of the columns
print(so_survey_df[['Paid_Job', 'ConvertedSalary']].head())
Redigera och kör kod