Kom igångKom igång gratis

Imputera saknade värden med percentiler

I den här övningen fortsätter du att öva på att imputera saknade värden. Till skillnad från föregående övning använder du percentiler i stället för medelvärden för att beräkna imputationerna. Percentiler är ett bra sätt att få konservativa imputationer. Att imputera saknade värden i en kolumn med hjälp av percentiler innebär följande steg:

  • Ta bort de saknade värdena från den aktuella kolumnen.
  • Beräkna sedan, till exempel, den 70:e percentilen av talen från kolumnen där du just tog bort de saknade värdena.
  • Det 70:e percentilens sämsta värde beror på vilken kolumn du beräknar percentilen från:
    • En stor mängd tillgångar anses till exempel vara positivt, så en låg mängd tillgångar är sämre. Det 70:e percentilens sämsta värde för tillgångar är alltså den 30:e percentilen av tillgångar.
    • På motsvarande sätt anses höga skulder vara negativt. Det 70:e sämsta värdet för skulder är därför helt enkelt dess 70:e percentil.

pandas har laddats med aliaset pd och NumPy med aliaset np. En pandas DataFrame med namnet dataset har laddats in. Den innehåller kolumnen "Total Current Liabilities", som har några saknade värden.

Den här övningen är en del av kursen

Analysera finansiella rapporter i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Impute missing value with 70th percentile non-missing values of company
impute_by_company = ___

# Impute missing value with 70th percentile non-missing values of industry
impute_by_comp_type = ____

print(impute_by_company)
print(impute_by_comp_type)
Redigera och kör kod