Mulai sekarangMulai gratis

Mengunduh Data dengan Wget dan curl

Untuk memulai sebuah proyek analisis data, praktik yang baik adalah terlebih dahulu mengonsolidasikan semua data ke satu tempat. Sering kali, ini berarti mengunduh dan mengambil data dari berbagai lokasi seperti server HTTP dan basis data.

Walaupun curl praktis untuk mengunduh satu berkas, alat ini kurang efisien untuk menangani unduhan banyak berkas. Dalam latihan penutup ini, kita akan menggunakan curl dan Wget untuk mengunduh serangkaian berkas Spotify bulanan, melakukan sedikit pemrosesan, dan mengonsolidasikan semua berkas yang diunduh di direktori lokal.

Latihan ini merupakan bagian dari kursus

Pemrosesan Data di Shell

Lihat Kursus

Instruksi latihan

  • Unduh data terkompres 201812SpotifyData yang disimpan pada URL yang dipendekkan (dialihkan) menggunakan curl. Pada langkah yang sama, ubah nama berkas menjadi Spotify201812.zip.
  • Ekstrak Spotify201812.zip, hapus berkas zip aslinya, dan ubah nama berkas hasil ekstrak menjadi Spotify201812.csv agar tetap konsisten.
  • Gunakan url_list.txt dan Wget untuk mengunduh ketiga berkas: Spotify201809.csv, Spotify201810.csv, dan Spotify201811.csv dalam satu langkah, dengan batas atas kecepatan unduhan 2500KB/s.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
Edit dan Jalankan Kode