Wget और curl के साथ डेटा डाउनलोडिंग
किसी डेटा विश्लेषण प्रोजेक्ट की शुरुआत में, सबसे पहले अपना सारा डेटा एक जगह इकट्ठा करना अच्छी प्रैक्टिस है. अक्सर इसका मतलब होता है कि हमें HTTP सर्वर और डेटाबेस जैसे अलग-अलग स्रोतों से डेटा डाउनलोड/खिंचकर लाना पड़ता है.
curl एकल फ़ाइल डाउनलोड करने में उपयोगी है, लेकिन कई फ़ाइलों को संभालने में यह कुछ असुविधाजनक हो सकता है. इस कैपस्टोन अभ्यास में, हम curl और Wget दोनों का उपयोग करके Spotify की मासिक फ़ाइलों की एक शृंखला डाउनलोड करेंगे, थोड़ा-सा प्रोसेसिंग करेंगे, और सभी डाउनलोड की गई फ़ाइलों को अपनी लोकल डायरेक्टरी में समेकित करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
शेल में डेटा प्रोसेसिंग
अभ्यास निर्देश
- शॉर्ट किए गए (redirected) URL से
curlका उपयोग करके ज़िप की गई201812SpotifyDataडेटा फ़ाइल डाउनलोड करें. उसी स्टेप में फ़ाइल का नामSpotify201812.zipरखें. Spotify201812.zipको अनज़िप करें, मूल ज़िप फ़ाइल को डिलीट करें, और consistency बनाए रखने के लिए अनज़िप की गई फ़ाइल का नामSpotify201812.csvरखें.url_list.txtऔरWgetका उपयोग करके एक ही स्टेप में सभी 3 फ़ाइलें डाउनलोड करें:Spotify201809.csv,Spotify201810.csv, औरSpotify201811.csv, अधिकतम डाउनलोड गति 2500KB/s की सीमा के साथ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip
# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv
# View url_list.txt to verify content
cat url_list.txt
# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt
# Take a look at all files downloaded
ls