शुरू करेंमुफ़्त में शुरू करें

Wget और curl के साथ डेटा डाउनलोडिंग

किसी डेटा विश्लेषण प्रोजेक्ट की शुरुआत में, सबसे पहले अपना सारा डेटा एक जगह इकट्ठा करना अच्छी प्रैक्टिस है. अक्सर इसका मतलब होता है कि हमें HTTP सर्वर और डेटाबेस जैसे अलग-अलग स्रोतों से डेटा डाउनलोड/खिंचकर लाना पड़ता है.

curl एकल फ़ाइल डाउनलोड करने में उपयोगी है, लेकिन कई फ़ाइलों को संभालने में यह कुछ असुविधाजनक हो सकता है. इस कैपस्टोन अभ्यास में, हम curl और Wget दोनों का उपयोग करके Spotify की मासिक फ़ाइलों की एक शृंखला डाउनलोड करेंगे, थोड़ा-सा प्रोसेसिंग करेंगे, और सभी डाउनलोड की गई फ़ाइलों को अपनी लोकल डायरेक्टरी में समेकित करेंगे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

शेल में डेटा प्रोसेसिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • शॉर्ट किए गए (redirected) URL से curl का उपयोग करके ज़िप की गई 201812SpotifyData डेटा फ़ाइल डाउनलोड करें. उसी स्टेप में फ़ाइल का नाम Spotify201812.zip रखें.
  • Spotify201812.zip को अनज़िप करें, मूल ज़िप फ़ाइल को डिलीट करें, और consistency बनाए रखने के लिए अनज़िप की गई फ़ाइल का नाम Spotify201812.csv रखें.
  • url_list.txt और Wget का उपयोग करके एक ही स्टेप में सभी 3 फ़ाइलें डाउनलोड करें: Spotify201809.csv, Spotify201810.csv, और Spotify201811.csv, अधिकतम डाउनलोड गति 2500KB/s की सीमा के साथ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
कोड संपादित करें और चलाएँ