Binarisering av kolumner
Numeriska värden kan ofta användas direkt utan feature engineering, men ibland kan någon form av bearbetning vara användbar. I vissa situationer spelar storleken på ett värde ingen roll – det enda som är intressant är dess riktning, eller om det överhuvudtaget existerar. I sådana fall är det lämpligt att binarisera en kolumn. I datamängden so_survey_df finns ett stort antal respondenter som arbetar frivilligt, det vill säga utan lön. Du ska skapa en ny kolumn med namnet Paid_Job som anger om varje person är avlönad (det vill säga om lönen är större än noll).
Den här övningen är en del av kursen
Särdragshantering för maskininlärning i Python
Övningsinstruktioner
- Skapa en ny kolumn med namnet
Paid_Jobfylld med nollor. - Ersätt alla värden i
Paid_Jobmed 1 där motsvarande värde iConvertedSalaryär större än 0.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create the Paid_Job column filled with zeros
so_survey_df[____] = ____
# Replace all the Paid_Job values where ConvertedSalary is > 0
so_survey_df.____[____, 'Paid_Job'] = 1
# Print the first five rows of the columns
print(so_survey_df[['Paid_Job', 'ConvertedSalary']].head())