Téléchargement de données avec Wget et curl
Pour démarrer un projet d'analyse de données, il est judicieux de regrouper d'abord toutes vos données au même endroit. Bien souvent, cela signifie télécharger et récupérer des données à partir de diverses sources, comme des serveurs HTTP et des bases de données.
Même si curl est pratique pour télécharger un seul fichier, il devient moins commode quand il faut gérer plusieurs téléchargements. Dans cet exercice de synthèse, nous allons utiliser à la fois curl et Wget pour télécharger une série de fichiers Spotify mensuels, effectuer un léger traitement, puis regrouper tous les fichiers téléchargés dans notre répertoire local.
Cette activité fait partie du cours
Traitement des données en Shell
Instructions de l’exercice
- Téléchargez l'archive compressée
201812SpotifyDataà partir de l'URL raccourcie (redirigée) aveccurl. Dans la même étape, renommez le fichier enSpotify201812.zip. - Décompressez
Spotify201812.zip, supprimez l'archive d'origine, puis renommez le fichier décompressé enSpotify201812.csvpour rester cohérent. - Utilisez
url_list.txtetWgetpour télécharger en une seule étape les 3 fichiersSpotify201809.csv,Spotify201810.csvetSpotify201811.csv, avec une vitesse de téléchargement plafonnée à 2500 KB/s.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip
# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv
# View url_list.txt to verify content
cat url_list.txt
# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt
# Take a look at all files downloaded
ls