Datanedladdning med Wget och curl
När du startar ett dataanalaysprojekt är det god praxis att samla all data på ett och samma ställe. Det innebär ofta att du behöver ladda ned och hämta data från olika källor, till exempel HTTP-servrar och databaser.
Medan curl är praktiskt för att ladda ned en enskild fil, kan det bli lite omständligt när du behöver hantera flera filer samtidigt. I den här avslutande övningen använder vi både curl och Wget för att ladda ned en serie månatliga Spotify-filer, göra lite enklare bearbetning och samla alla nedladdade filer i vår lokala katalog.
Den här övningen är en del av kursen
Databehandling i kommandoraden
Övningsinstruktioner
- Ladda ned den zippade filen
201812SpotifyDatafrån den förkortade (omdirigerade) URL:en medcurl. Döp samtidigt filen tillSpotify201812.zip. - Packa upp
Spotify201812.zip, ta bort den ursprungliga zippade filen och döp den uppackade filen tillSpotify201812.csvför att hålla en konsekvent namngivning. - Använd
url_list.txtochWgetför att ladda ned alla 3 filer –Spotify201809.csv,Spotify201810.csvochSpotify201811.csv– i ett enda steg, med en maximal nedladdningshastighet på 2 500 KB/s.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip
# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv
# View url_list.txt to verify content
cat url_list.txt
# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt
# Take a look at all files downloaded
ls