Folge dem Geld

In dieser Übung arbeitest du mit einer anderen Version des DataFrame banking, die sowohl für die Spalte cust_id als auch für die Spalte acct_amount fehlende Werte enthält.

Du möchtest Analysen darüber erstellen, wie viele einzelne Kunden die Bank hat, wie hoch das durchschnittliche Vermögen der Kunden ist und mehr. Du weißt, dass Zeilen, in denen cust_id fehlt, dir nicht weiterhelfen und dass acct_amount im Durchschnitt fünfmal so groß ist wie inv_amount.

In dieser Übung löschst du Zeilen aus banking, die fehlende Werte bei cust_id haben und ersetzt fehlende Werte von acct_amount mithilfe von Wissen über den Kontext der Daten.

Diese Übung ist Teil des Kurses

<Kurs>Datenbereinigung in Python</Kurs>

Übungsanweisungen

Verwende .dropna(), um fehlende Werte der Spalte cust_id in banking zu löschen, und speichere die Ergebnisse in banking_fullid.
Verwende inv_amount, um die geschätzten Kontobeträge für banking_fullid zu berechnen, indem du die Beträge mit inv_amount * 5 gleichsetzt, und ordne die Ergebnisse acct_imp zu.
Ergänze die fehlenden Werte von acct_amount in banking_fullid mit den neu erstellten Werten von acct_imp unter Verwendung von .fillna().

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Drop missing values of cust_id
banking_fullid = banking.____(subset = ['____'])

# Compute estimated acct_amount
acct_imp = ____

# Impute missing acct_amount with corresponding acct_imp
banking_imputed = banking_fullid.____({'____':____})

# Print number of missing values
print(banking_imputed.isna().sum())

Code bearbeiten und ausführen

Diese Übung ist Teil des Kurses

<Kurs>Datenbereinigung in Python</Kurs>

Mittlere SchwierigkeitSchwierigkeitsgrad

4.8+

Kurs kostenlos starten

In diesem Kapitel erfährst du, wie du einige der häufigsten Probleme mit unsauberen Daten lösen kannst. Du konvertierst Datentypen, wendest Bereichsbeschränkungen an, um Datenpunkte mit einem Datum in der Zukunft zu entfernen, und entfernst doppelte Datenpunkte, um Doppelzählungen zu vermeiden.

Exercise 1: Datentypbeschränkungen Exercise 2: Häufig verwendete Datentypen Exercise 3: Numerische Daten oder ... ?Exercise 4: Summieren von Zeichenketten und Verketten von Zahlen Exercise 5: Einschränkungen des Datenbereichs Exercise 6: Reifengrößenbeschränkung Exercise 7: Zurück in die Zukunft Exercise 8: Eindeutigkeitsbeschränkungen Exercise 9: Wie groß ist deine Teilmenge?Exercise 10: Duplikate ermitteln Exercise 11: Behandlung von Duplikaten

Kategoriale Daten und Textdaten gehören oft zu den unübersichtlichsten Teilen eines Datensatzes, weil sie unstrukturiert sind. In diesem Kapitel erfährst du, wie du Unstimmigkeiten bei Leerzeichen und Großschreibung in Kategoriekennzeichnungen behebst, mehrere Kategorien zu einer zusammenfasst und Zeichenketten neu formatierst, um die Konsistenz zu gewährleisten.

Exercise 1: Einschränkung des Wertebereichs Exercise 2: Nur für Mitglieder Exercise 3: (In-)Konsistenzen ermitteln Exercise 4: Kategoriale Variablen Exercise 5: Fehlerkategorien Exercise 6: Inkonsistente Kategorien Exercise 7: Kategorien neu zuordnen Exercise 8: Bereinigen von Textdaten Exercise 9: Titel entfernen und Namen erfassen Exercise 10: Beschreibend bleiben

In diesem Kapitel beschäftigst du dich mit fortgeschrittenen Datenbereinigungsproblemen, z. B. damit wie du sicherstellen kannst, dass alle Gewichtsangaben in Kilogramm statt in Pfund angegeben werden. Du erwirbst außerdem wertvolle Fähigkeiten, mit denen du überprüfen kannst, ob Werte korrekt hinzugefügt wurden und ob fehlende Werte deine Analysen nicht negativ beeinflussen.

Exercise 1: Einheitlichkeit Exercise 2: Mehrdeutige Daten Exercise 3: Einheitliche Währungen Exercise 4: Einheitliche Datumsangaben Exercise 5: Feldübergreifende Validierung Exercise 6: Feldübergreifend oder nicht feldübergreifend?Exercise 7: Wie steht es um unsere Datenintegrität?Exercise 8: Vollständigkeit Exercise 9: Zufällig fehlend oder nicht?Exercise 10: Fehlende Investoren Exercise 11: Folge dem Geld

Aktuelle Übung

Die Datensatzverknüpfung ist eine leistungsstarke Technik, mit der mehrere Datensätze zusammengeführt werden können, wenn die Werte Tippfehler oder unterschiedliche Schreibweisen aufweisen. In diesem Kapitel lernst du, wie du Datensätze miteinander verknüpfst, indem du die Ähnlichkeit zwischen Zeichenketten berechnest, und dann deine neuen Kenntnisse einsetzt, um zwei Restaurantbewertungsdatensätze zu einem einzigen, sauberen Masterdatensatz zu verbinden.

Exercise 1: Zeichenketten vergleichen Exercise 2: Minimale Editierdistanz Exercise 3: Der Abschneidepunkt Exercise 4: Kategorien neu ordnen II Exercise 5: Paare generieren Exercise 6: Verlinken oder nicht verlinken?Exercise 7: Restaurantpaare Exercise 8: Ähnliche Restaurants Exercise 9: DataFrames verknüpfen Exercise 10: Den richtigen Index finden Exercise 11: Verbinde sie miteinander!Exercise 12: Glückwunsch!