【发布时间】:2021-09-16 23:02:09
【问题描述】:
我有一个数据集要研究,但我不知道如何处理它,我非常感谢这里的一些指导。我需要我应该计算的关键字和指标以及应用方法。任何阅读在线示例的链接都非常受欢迎!!!
数据集是根据以下概念形成的: 鱼缸里有 100 条鱼,我研究了每条鱼的 2 个健康问题(原因 A 和原因 B)。原因可能会随着鱼身体某些部位出现的症状变得明显:胃、眼睛、皮肤。
因此,数据集将具有以下格式:
Fish_ID body_part cause
1 eye A
1 stomach B
1 skin A
2 eye Nan
2 stomach B
2 skin A
3 eye B
3 stomach A
3 skin A
100 eye Nan
100 stomach Nan
100 skin A
我想看看症状之间是否存在模式或相关性。下面我举个例子。
- 原因 A,眼部问题经常伴随皮肤问题,但胃部问题更独立。
- 原因 B,不同身体部位的症状是独立的。
我们的想法是研究两个或更多身体部位是否可能会出现相同原因的症状,或者换句话说,是否有问题(问题可能是病毒或环境因素 - 这并不重要)可能针对或多或少相同的不同身体部位。
提前感谢您的所有想法和建议,非常感谢,如果这不是一个很好的问题,我深表歉意。
【问题讨论】:
-
有趣的问题,但这里不是主题;请尝试 stats.stackexchange.com。我的建议是让它尽可能简单;我认为仅根据原因将症状制成表格就足够了。 IE。针对每个原因,制作一张症状表。
-
谢谢罗伯特,我正在尝试通过对原因进行分类来解决这个问题(3 类:A、B 和 NaN 分别转换为数字 1、-1 和 0)。然后,我将拆分 body_part 列以使其成为列,并且这些列中的值应该是类。我正在考虑
df.corr()最后一帧来查看高度相关的对。也许,稍后,我会在 stats 上创建一个帐户,并使用我刚才描述的这种方法将其发布到那里。 -
普通相关在这里没有任何意义。一方面,没有将类别编码为数字的唯一方法。每种不同的编码都会产生不同的结果,没有理由偏爱一种或另一种。互信息对分类数据有意义,所以这是一个选择,虽然不是那么有启发性;您将计算 MI 为 0.2 或 0.4 位,然后呢?当您重新发布您的问题时,您可能想要更多地说明您正在努力实现的更大目标。
标签: python pandas statistics probability correlation