【问题标题】:data processing using r使用 r 进行数据处理
【发布时间】:2013-04-06 10:14:45
【问题描述】:

我有一个包含几列的 .ped 文件,我想从中提取信息。 这是我的数据示例(没有标题):

1  1  1 
1  2  1
2  3  2
3  4  1
3  5  2
...

第一列表示ID家族,第二列表示ID个体,第三列表示个体性别。

我将表格作为数据框读取

ped <- read.table("pedigree.ped", header=FALSE)

我如何计算存在的家庭数量(一个家庭可以出现多次,我想将它们视为一个家庭)? 我有一个性别列,其中 1 指定男性和 2 女性,我如何获得数据集中男性和女性的分布?

我是 R 的新手,如果你能提供一些代码!

提前致谢。

【问题讨论】:

  • 请发布您的数据样本。
  • ^^^this - head(ped)
  • 请给我索引

标签: r


【解决方案1】:

由于您是 R 新手,我建议您先研究一下 excel。您要求的操作相当简单,可以在excel中完成。

如果您想使用 R,请查看 data.frame 索引、子集等。

如果您熟悉 SQL,请关注sqldf package

家庭数量:

numFamilies <- length(unique(ped[,1]))

男女人数:

numMales <- sum(ped[,3] == 1)
numFemales <- sum(ped[,3] == 2)

【讨论】:

  • SQL和R是什么关系?!!
  • 许多 R 语法新手都熟悉 sql 接口。 select、count、groupby 等。您可以使用 sqldf 包查询 data.frame 对象。
  • @e4e5f4 :不一定。
  • OP:更新了我的答案。 user1493368:是的,我应该突出显示“如果您熟悉 sql”部分 :)
【解决方案2】:

尝试使用它来探索数据:

For family:
table(ped[,1])

For sex: 
table(ped[,3])

【讨论】:

    猜你喜欢
    • 2022-01-17
    • 2018-01-13
    • 2020-12-09
    • 1970-01-01
    • 2011-11-06
    • 2017-03-16
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多