辞書の再構成
政治家データをクリーンアップして、Dask DataFrame に移したいと考えています。ただし、この政治家データは入れ子構造になっているため、DataFrame に収まる形にするには、もう少し前処理が必要です。
取り出したいデータのひとつは、辞書のかなり深い層に埋もれています。各政治家のウェブサイトへのリンクです。以下の例は、そのリンクが辞書内にどのように格納されているかを示しています。
record = {
...
'links': [{'note': '...',
'url': '...'},], # ここに格納されています
...
}
政治家データの bag は、環境内で dict_bag として利用できます。
この演習はコースの一部です
Pythonで学ぶDaskによる並列プログラミング
演習の手順
extract_url()関数を完成させ、'links'キーの下にあるリストの0番目の要素に含まれる辞書から'url'キーを取り出し、これをキーurlに代入します。extract_url()関数を bag のすべての要素に対して実行します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
def extract_url(x):
# Extract the url and assign it to the key 'url'
x['url'] = x[____][____][____]
return x
# Run the function on all elements in the bag.
dict_bag = ____
print(dict_bag.take(1))