ÎncepețiÎncepe gratuit

Gestionarea caracterelor nedorite (II)

În exercițiul anterior, ai putut identifica rapid caracterele problematice folosind df.head(). În multe cazuri, însă, lucrurile nu vor fi atât de evidente. Adesea, valorile care împiedică conversia unei coloane la tip numeric se ascund adânc în date, blocând astfel utilizarea coloanei într-un model sau în procesul de inginerie a caracteristicilor.

O abordare pentru a găsi aceste valori este să forțezi conversia coloanei la tipul dorit folosind pd.to_numeric(), transformând valorile problematice în NaN, apoi să filtrezi DataFrame-ul păstrând doar rândurile care conțin aceste valori NaN.

Încearcă să convertești coloana RawSalary la tipul float – operațiunea va eșua, deoarece în coloană se află acum un caracter suplimentar nedorit. Identifică acel caracter și elimină-l, astfel încât coloana să poată fi convertită la float.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru Machine Learning în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Attempt to convert the column to numeric values
numeric_vals = ____(so_survey_df['RawSalary'], errors='coerce')

# Find the indexes of missing values
idx = ____

# Print the relevant rows
print(so_survey_df['RawSalary']____)
Editează și rulează codul