Zagnieżdżone dane o filmach
Masz na komputerze zbiór danych movies, który zawiera informacje o różnych filmach i chcesz się mu bliżej przyjrzeć. Chcesz przeanalizować te dane, ale okazuje się, że są w zagnieżdżonym formacie JSON.
Aby wczytać je do DataFrame, musisz użyć poznanej właśnie funkcji. Następnie przekształcisz wynikowy DataFrame, żeby łatwiej było z nim pracować.
Półustrukturyzowany JSON o nazwie movies jest już dostępny. Koniecznie sprawdź jego zawartość w konsoli!
To ćwiczenie jest częścią kursu
Przekształcanie danych z pandas
Instrukcje do ćwiczenia
- Zaimportuj funkcję
json_normalize()z bibliotekipandas. - Znormalizuj JSON zawarty w
movies. Nazwy generowane z zagnieżdżonych rekordów oddziel znakiem podkreślenia. - Przekształć wynikowy DataFrame
movies_normz formatu szerokiego do długiego, używając kolumndirectoriproducerjako unikalnych indeksów. Nowej zmiennej utworzonej z kolumn nadaj nazwęmovies, zaczynając odfeatures, oddzielonej znakiem podkreślenia, z sufiksem zawierającym słowa.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the json_normalize function
____
# Normalize movies and separate the new columns with an underscore
movies_norm = ____(____, sep=____)
# Reshape using director and producer as index, create movies from column starting from features
movies_long = pd.____(____, stubnames=____,
i=____, j=____,
sep=____, suffix=____)
# Print movies_long
print(movies_long)