Inizia subitoInizia gratis

Download dei dati con Wget e curl

Per avviare un progetto di analisi dei dati, è buona pratica prima consolidare tutti i dati in un unico posto. Spesso questo significa scaricare e recuperare dati da varie fonti come server HTTP e database.

Sebbene curl sia comodo per scaricare un singolo file, è un po’ scomodo per gestire più download. In questo esercizio finale useremo sia curl sia Wget per scaricare una serie di file mensili di Spotify, fare un po’ di elaborazione minima e consolidare tutti i file scaricati nella nostra directory locale.

Questo esercizio fa parte del corso

Elaborazione dei dati in Shell

Visualizza corso

Istruzioni dell'esercizio

  • Scarica con curl il file zippato 201812SpotifyData salvato all’URL abbreviato (reindirizzato). Nello stesso passaggio, rinomina il file in Spotify201812.zip.
  • Decomprimi Spotify201812.zip, elimina l’archivio originale e rinomina il file estratto in Spotify201812.csv per mantenere coerenza.
  • Usa url_list.txt e Wget per scaricare in un solo passaggio tutti e 3 i file: Spotify201809.csv, Spotify201810.csv e Spotify201811.csv, con una velocità massima di download pari a 2500KB/s.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
Modifica ed esegui il codice