Porovnání simulovaných a historických dat
Dobrá simulace by měla dávat výsledky podobné historickým datům. Platilo to i pro simulaci z videa? V tomto cvičení se podíváš na jeden ze způsobů, jak výsledky simulace prozkoumat!
Nejdřív provedeš simulaci pomocí vícerozměrného normálního rozdělení s využitím průměru a kovarianční matice datasetu dia. Pak porovnáš průměry historických a simulovaných dat. Jsou si podobné?
Dataset diabetiků je načtený jako DataFrame dia a jsou pro tebe naimportovány tyto knihovny: pandas jako pd, numpy jako np a scipy.stats jako st.
Toto cvičení je součástí kurzu
Monte Carlo simulace v Pythonu
Pokyny k cvičení
- Proveď simulaci 10 000krát pomocí vícerozměrného normálního rozdělení s využitím průměru a kovarianční matice datasetu
dia. - Pomocí funkce
.mean()z pandas vypočítej průměrné hodnoty sloupcůbmiatcv historickém datasetudiai v simulovaných výsledcíchbmiatczdf_resultsa ověř, jestli jsou si podobné. - Stejným způsobem použij
.cov()z pandas k výpočtu kovarianční matice sloupcůbmiatcdatasetudiai simulovaných výsledkůbmiatczdf_resultsa ověř jejich podobnost.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
cov_dia = dia[["age", "bmi", "bp", "tc", "ldl", "hdl", "tch", "ltg", "glu"]].cov()
mean_dia = dia[["age", "bmi", "bp", "tc", "ldl", "hdl", "tch", "ltg", "glu"]].mean()
# Complete the code to perform the simulation
simulation_results = st.multivariate_normal.rvs(____)
df_results = pd.DataFrame(simulation_results,columns=["age", "bmi", "bp", "tc", "ldl", "hdl", "tch", "ltg", "glu"])
# Calculate bmi and tc means for the historical and simulated results
print(dia[["bmi","tc"]].____)
print(____)
# Calculate bmi and tc covariances for the historical and simulated results
print(____)
print(____)