【发布时间】:2015-01-01 01:50:05
【问题描述】:
我是 PyMC 的新手,正在尝试建立简单的条件概率模型:P(has_diabetes|bmi, race)。 Race 可以采用 5 个离散值,编码为 0-4,BMI 可以采用非零正实数。到目前为止,我的父变量设置如下:
p_race = [0.009149232914923292,
0.15656903765690378,
0.019637377963737795,
0.013947001394700141,
0.800697350069735]
race = pymc.Categorical('race', p_race)
bmi_alpha = pymc.Exponential('bmi_alpha', 1)
bmi_beta = pymc.Exponential('bmi_beta', 1)
bmi = pymc.Gamma('bmi', bmi_alpha, bmi_beta, value=bmis, observed=True)
我观察到的数据如下:
|体重指数 |种族 |有糖尿病|
| 21.7 | 1 | 0 |
| 45.3 | 4 | 1 |
| 18.9 | 2 | 0 |
| 26.6 | 0 | 0 |
| 35.1 | 4 | 0 |
我正在尝试将has_diabetes 建模为:
has_diabetes = pymc.Bernoulli('has_diabetes', p_diabetes, value=data, observed=True)
我的问题是我不确定如何构造p_diabetes 函数,因为它依赖于race 的值和bmi 的连续值。
【问题讨论】:
标签: probability pymc