Mengunduh Data dengan Wget dan curl
Untuk memulai sebuah proyek analisis data, praktik yang baik adalah terlebih dahulu mengonsolidasikan semua data ke satu tempat. Sering kali, ini berarti mengunduh dan mengambil data dari berbagai lokasi seperti server HTTP dan basis data.
Walaupun curl praktis untuk mengunduh satu berkas, alat ini kurang efisien untuk menangani unduhan banyak berkas. Dalam latihan penutup ini, kita akan menggunakan curl dan Wget untuk mengunduh serangkaian berkas Spotify bulanan, melakukan sedikit pemrosesan, dan mengonsolidasikan semua berkas yang diunduh di direktori lokal.
Latihan ini merupakan bagian dari kursus
Pemrosesan Data di Shell
Instruksi latihan
- Unduh data terkompres
201812SpotifyDatayang disimpan pada URL yang dipendekkan (dialihkan) menggunakancurl. Pada langkah yang sama, ubah nama berkas menjadiSpotify201812.zip. - Ekstrak
Spotify201812.zip, hapus berkas zip aslinya, dan ubah nama berkas hasil ekstrak menjadiSpotify201812.csvagar tetap konsisten. - Gunakan
url_list.txtdanWgetuntuk mengunduh ketiga berkas:Spotify201809.csv,Spotify201810.csv, danSpotify201811.csvdalam satu langkah, dengan batas atas kecepatan unduhan 2500KB/s.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip
# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv
# View url_list.txt to verify content
cat url_list.txt
# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt
# Take a look at all files downloaded
ls