【问题标题】:Biological variance or truly affected genes.生物变异或真正受影响的基因。
【发布时间】:2017-05-15 12:39:16
【问题描述】:

我是一名生物学专业的学生,​​在我们的实验室中,我们正在小鼠身上测试某种药物。正常状态下,我们有很多组生物复制的基因表达数据: gene replicate 1 replicate2 gene1 -0.842138 -0.701153 gene2 -0.796896 -0.725085 gene3 -0.835920 -0.707572 gene5 -0.702721 -0.724579 gene6 -0.815476 -0.737112 .... gene 20000 each dot represent a gene

给它们喂药后,我们有一个新的基因表达数据: after medicine treatment

我的问题是,我如何才能将那些真正受影响的基因与那些只是生物学差异(重复之间的差异)分开?

我是机器学习的新手,我相信监督学习应该是我的选择,对吧?训练数据是我的复制数据,然后我可以测试药物治疗后的每个基因是否可以落入复制定义的“耐受区”。但我不确定我应该使用哪种方法。提前感谢任何指导。

【问题讨论】:

  • 天哪。我需要一分钟..

标签: python r machine-learning


【解决方案1】:

首先欢迎来到 Stack Overflow!其次我真的认为这个问题应该移到这里:DataScienceArtificial Intelligence。尽管如此,我会尽力帮助您回答。

我有几个问题,当你回答这些问题时,你应该以正确的方式实际解决这个问题:

  1. 您如何将数据拆分为训练数据(您将总体数据的百分比用于训练目的)?
  2. 您是否为最初引入化学品的基因建立了界限?
  3. 您最初期望的差异是什么?
  4. 测试完成后,方差的边界是否发生了显着变化?
  5. 您打算使用哪些算法来解决这个特定问题?
  6. 您打算使用EDA 以获得更好的洞察力吗?
  7. 你有没有想过用K-means来观察“新药”引入后数据簇的变化?

我个人会计算这些基因的平均值和标准差,并在引入药物后做同样的事情。这应该可以帮助您深入了解边界是如何变化的,以及最有可能发生传播的位置。另外,如果您有选择,请始终使用 EDA(我知道我对此很说教,但它有很大帮助)。我认为这应该可以帮助您更好地了解您的问题。希望对您有所帮助。

算法的有用链接:Machine Learning Algorithms

【讨论】:

  • 我建议这样做。最好的办法是熟悉算法,并看看遗传算法。希望我的回答对你有所帮助。
  • 我的问题可能太天真了...我应该学习更多的统计知识然后问...1。所有的复制数据都是我的训练数据。 2. 我认为重复中的每个基因表达数据都定义了边界。就像在我的第一个散点图中,虚线区域定义了“耐受区”,然后在药物治疗后,我想找出哪些基因发生了显着变化(落在耐受区) 7. 确实有点像 k-means 集群,期待我不知道如何定义cluster1(重复之间的变化)和cluster2(药物治疗后显着受影响的基因)
  • @AlicePsyche 你知道该读什么,从哪里开始。我建议您不要将整个数据用作训练数据,而是将其拆分为 30% 到 70% 或 40% 到 60% 之类的数据。查看 K-means 并熟悉您应该如何决定需要多少个集群。网上也有很多关于机器学习的代码示例,尤其是 Python。
  • @ZombieChowder:迁移意见和您的问题列表属于 cmets,而不是答案。
  • 你问的我没问题;我只是建议将最初的评论和七点转移到 cmets。我会留下最后一段和这个答案中的链接。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2014-02-26
  • 2011-02-25
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-12-07
相关资源
最近更新 更多