CommencezCommencez gratuitement

Téléchargement de données avec Wget et curl

Pour démarrer un projet d'analyse de données, il est judicieux de regrouper d'abord toutes vos données au même endroit. Bien souvent, cela signifie télécharger et récupérer des données à partir de diverses sources, comme des serveurs HTTP et des bases de données.

Même si curl est pratique pour télécharger un seul fichier, il devient moins commode quand il faut gérer plusieurs téléchargements. Dans cet exercice de synthèse, nous allons utiliser à la fois curl et Wget pour télécharger une série de fichiers Spotify mensuels, effectuer un léger traitement, puis regrouper tous les fichiers téléchargés dans notre répertoire local.

Cette activité fait partie du cours

Traitement des données en Shell

Voir le cours

Instructions de l’exercice

  • Téléchargez l'archive compressée 201812SpotifyData à partir de l'URL raccourcie (redirigée) avec curl. Dans la même étape, renommez le fichier en Spotify201812.zip.
  • Décompressez Spotify201812.zip, supprimez l'archive d'origine, puis renommez le fichier décompressé en Spotify201812.csv pour rester cohérent.
  • Utilisez url_list.txt et Wget pour télécharger en une seule étape les 3 fichiers Spotify201809.csv, Spotify201810.csv et Spotify201811.csv, avec une vitesse de téléchargement plafonnée à 2500 KB/s.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
Modifier et exécuter le code