【问题标题】:Correlation and probability among categorical data of a dataframe - metrics (suggestions)数据框的分类数据之间的相关性和概率 - 指标(建议)
【发布时间】:2021-09-16 23:02:09
【问题描述】:

我有一个数据集要研究,但我不知道如何处理它,我非常感谢这里的一些指导。我需要我应该计算的关键字和指标以及应用方法。任何阅读在线示例的链接都非常受欢迎!!!

数据集是根据以下概念形成的: 鱼缸里有 100 条鱼,我研究了每条鱼的 2 个健康问题(原因 A 和原因 B)。原因可能会随着鱼身体某些部位出现的症状变得明显:胃、眼睛、皮肤。

因此,数据集将具有以下格式:

Fish_ID   body_part   cause
      1         eye       A
      1     stomach       B
      1        skin       A
      2         eye     Nan
      2     stomach       B
      2        skin       A
      3         eye       B
      3     stomach       A
      3        skin       A
    100         eye     Nan
    100     stomach     Nan
    100        skin       A

我想看看症状之间是否存在模式或相关性。下面我举个例子。

  • 原因 A,眼部问题经常伴随皮肤问题,但胃部问题更独立。
  • 原因 B,不同身体部位的症状是独立的。

我们的想法是研究两个或更多身体部位是否可能会出现相同原因的症状,或者换句话说,是否有问题(问题可能是病毒或环境因素 - 这并不重要)可能针对或多或少相同的不同身体部位。

提前感谢您的所有想法和建议,非常感谢,如果这不是一个很好的问题,我深表歉意。

【问题讨论】:

  • 有趣的问题,但这里不是主题;请尝试 stats.stackexchange.com。我的建议是让它尽可能简单;我认为仅根据原因将症状制成表格就足够了。 IE。针对每个原因,制作一张症状表。
  • 谢谢罗伯特,我正在尝试通过对原因进行分类来解决这个问题(3 类:A、B 和 NaN 分别转换为数字 1、-1 和 0)。然后,我将拆分 body_part 列以使其成为列,并且这些列中的值应该是类。我正在考虑df.corr() 最后一帧来查看高度相关的对。也许,稍后,我会在 stats 上创建一个帐户,并使用我刚才描述的这种方法将其发布到那里。
  • 普通相关在这里没有任何意义。一方面,没有将类别编码为数字的唯一方法。每种不同的编码都会产生不同的结果,没有理由偏爱一种或另一种。互信息对分类数据有意义,所以这是一个选择,虽然不是那么有启发性;您将计算 MI 为 0.2 或 0.4 位,然后呢?当您重新发布您的问题时,您可能想要更多地说明您正在努力实现的更大目标。

标签: python pandas statistics probability correlation


【解决方案1】:

您需要对 body_part 列进行热编码,因为值是离散的,然后您可以使用许多机器学习技术找到关系。在这种情况下工作的非常基本的可视化技术之一是小提琴图,您可以通过它得出结论,并且列原因只有 2 个离散值,因此它也可以进行热编码,并且应该设置为目标变量。

violin plots点击此链接了解小提琴情节的更详细说明

【讨论】:

  • 感谢您的建议。我将首先开始研究小提琴情节。你能解释一下“热编码”这个词吗?
  • 当数据包含数字或连续元素,如 [0, 0.5, 1, 1.2, 2.3......] 时,它们被称为连续数据。但是当数据是离散的,比如血液测试数据的结果仅限于某些输出,要么是正的要么是负的,所以在这种情况下,我们对值进行热编码,但假设正 => 1 和负 => 0 以使数据在数学上兼容你必须在互联网上找到更详细的解释。如果发现 helpfll,请接受解决方案。
猜你喜欢
  • 2019-10-15
  • 2020-01-16
  • 1970-01-01
  • 1970-01-01
  • 2022-10-13
  • 2022-08-11
  • 2020-12-11
  • 1970-01-01
  • 2023-03-04
相关资源
最近更新 更多