Kom igångKom igång gratis

Datanedladdning med Wget och curl

När du startar ett dataanalaysprojekt är det god praxis att samla all data på ett och samma ställe. Det innebär ofta att du behöver ladda ned och hämta data från olika källor, till exempel HTTP-servrar och databaser.

Medan curl är praktiskt för att ladda ned en enskild fil, kan det bli lite omständligt när du behöver hantera flera filer samtidigt. I den här avslutande övningen använder vi både curl och Wget för att ladda ned en serie månatliga Spotify-filer, göra lite enklare bearbetning och samla alla nedladdade filer i vår lokala katalog.

Den här övningen är en del av kursen

Databehandling i kommandoraden

Visa kurs

Övningsinstruktioner

  • Ladda ned den zippade filen 201812SpotifyData från den förkortade (omdirigerade) URL:en med curl. Döp samtidigt filen till Spotify201812.zip.
  • Packa upp Spotify201812.zip, ta bort den ursprungliga zippade filen och döp den uppackade filen till Spotify201812.csv för att hålla en konsekvent namngivning.
  • Använd url_list.txt och Wget för att ladda ned alla 3 filer – Spotify201809.csv, Spotify201810.csv och Spotify201811.csv – i ett enda steg, med en maximal nedladdningshastighet på 2 500 KB/s.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
Redigera och kör kod