Omstrukturering av en ordlista
Nu vill du städa upp politikerdata och flytta den till en Dask DataFrame. Eftersom datan är nästlad behöver du bearbeta den ytterligare innan den passar in i en DataFrame.
Ett visst dataelement du vill extrahera är begravt några nivåer inne i ordlistan. Det rör sig om en länk till en webbplats för varje politiker. Exemplet nedan visar hur det lagras i ordlistan.
record = {
...
'links': [{'note': '...',
'url': '...'},], # Lagras här
...
}
Bagen med politikerdata finns tillgänglig i din miljö som dict_bag.
Den här övningen är en del av kursen
Parallellprogrammering med Dask i Python
Övningsinstruktioner
- Komplettera funktionen
extract_url()så att den extraherar nyckeln'url'från ordlistan, som finns på nollte plats i listan under nyckeln'links', och tilldelar detta till nyckelnurl. - Kör funktionen
extract_url()över alla element i bagen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
def extract_url(x):
# Extract the url and assign it to the key 'url'
x['url'] = x[____][____][____]
return x
# Run the function on all elements in the bag.
dict_bag = ____
print(dict_bag.take(1))