Download dei dati con Wget e curl
Per avviare un progetto di analisi dei dati, è buona pratica prima consolidare tutti i dati in un unico posto. Spesso questo significa scaricare e recuperare dati da varie fonti come server HTTP e database.
Sebbene curl sia comodo per scaricare un singolo file, è un po’ scomodo per gestire più download. In questo esercizio finale useremo sia curl sia Wget per scaricare una serie di file mensili di Spotify, fare un po’ di elaborazione minima e consolidare tutti i file scaricati nella nostra directory locale.
Questo esercizio fa parte del corso
Elaborazione dei dati in Shell
Istruzioni dell'esercizio
- Scarica con
curlil file zippato201812SpotifyDatasalvato all’URL abbreviato (reindirizzato). Nello stesso passaggio, rinomina il file inSpotify201812.zip. - Decomprimi
Spotify201812.zip, elimina l’archivio originale e rinomina il file estratto inSpotify201812.csvper mantenere coerenza. - Usa
url_list.txteWgetper scaricare in un solo passaggio tutti e 3 i file:Spotify201809.csv,Spotify201810.csveSpotify201811.csv, con una velocità massima di download pari a 2500KB/s.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip
# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv
# View url_list.txt to verify content
cat url_list.txt
# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt
# Take a look at all files downloaded
ls