Datenverarbeitung mit csvkit
Sobald wir einen Datensatz zusammengestellt haben, müssen wir die Daten vor weiterführenden Analysen wie Predictive Modeling immer noch verarbeiten und bereinigen. In dieser abschließenden Übung nutzen wir verschiedene Befehle in csvkit für typische Schritte der Datenverarbeitung und -bereinigung.
Die Excel-Datei Spotify_201809_201810.xlsx enthält zwei Tabellenblätter (Tabs) namens Spotify201809 und Spotify201810. Zuerst teilen wir die Excel-Datei in ihre einzelnen Tabellenblätter auf, sehen uns zusammenfassende Statistiken an, entfernen einige Spalten und stapeln anschließend die beiden Blätter wieder zusammen zu einer einzigen csv-Datei, die für weitere Analysen bereit ist.
Diese Übung ist Teil des Kurses
<Kurs>Datenverarbeitung in der Shell</Kurs>Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Convert the Spotify201809 sheet into its own csv file
___ Spotify_201809_201810.xlsx ___ "___" ___ Spotify201809.csv
# Check to confirm name and location of data file
ls