CommencerCommencez gratuitement

Téléchargement de données avec Wget et curl

Pour démarrer un projet d’analyse de données, il est recommandé de regrouper d’abord toutes vos données au même endroit. Cela implique souvent de télécharger et de récupérer des données depuis différents emplacements comme des serveurs HTTP et des bases de données.

Si curl est pratique pour télécharger un seul fichier, il est moins adapté lorsqu’il faut en gérer plusieurs. Dans cet exercice de synthèse, nous allons utiliser à la fois curl et Wget pour télécharger une série de fichiers mensuels Spotify, effectuer quelques opérations simples, puis consolider tous les fichiers téléchargés dans notre répertoire local.

Cet exercice fait partie du cours

<cours>Traitement des données en ligne de commande</cours>
Voir le cours

Instructions de l’exercice

  • Téléchargez l’archive 201812SpotifyData depuis l’URL raccourcie (redirigée) à l’aide de curl. Dans la même commande, renommez le fichier en Spotify201812.zip.
  • Décompressez Spotify201812.zip, supprimez l’archive d’origine, puis renommez le fichier décompressé en Spotify201812.csv pour rester cohérent.
  • Utilisez url_list.txt et Wget pour télécharger en une seule étape les 3 fichiers Spotify201809.csv, Spotify201810.csv et Spotify201811.csv, avec une limite supérieure de vitesse de téléchargement de 2500 KB/s.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
Modifier et exécuter le code