【发布时间】:2013-12-18 07:14:56
【问题描述】:
抱歉,如果这是一个重复的问题,我不知道如何表达我的问题,并且我无法准确找到我正在寻找的内容。我对python和编程有点陌生。基本上,我有一个大型数据集,我试图将每个 ID 的每个主题(1 到 3)分组为一个行形式。它看起来像这样:
1 2 3 I
A A A 1
T T T 1
C C C 1
...
C C A 2
T T T 2
C C C 2
...
A A A 3
G G C 3
C C C 3
...
除了我的数据表要大得多。我用python将此表加载到熊猫中,使用以下内容:
grouped=dataframe.groupby('I')
testframe=[]
testframe.append(grouped[person].values)
test_data=DataFrame(testframe)
我得到了一些我期望的东西,但是当我将它打印到 CSV 时它只打印:
['G', 'T', 'T', ..., 'T', 'G', 'C']
如何让它打印所有值而不仅仅是一个子集?有没有更好的方法来实现我正在做的事情。整体输出是正确的,我只需要每个元素,而不是这个缩短的版本。我怎样才能做到这一点?
-edit- 增加我的意思的清晰度..
例如:len(test_data[0]['SomeGeneID'])
output: 2571 and prints the truncated list
len(test_data[0]['DifferentgeneID'])
output: 879 and prints entire list
我想我的问题是为什么会发生这种情况,我该如何预防,有没有比 pandas 更好的方法来实现我的目标?
【问题讨论】:
-
你用什么方法将它“打印到 CSV”?
-
在 0.13 中你将无法访问 groupby
values,我不确定你认为它是什么...... -
我使用 test_data.to_csv('whatever.csv') 并查看单元格,基本上具有小于 1000 个值的 ID 号倾向于完全打印,但不会打印较大的。我不太确定我在做什么,你是什么意思访问 groupby 值?我在我的测试框架列表中看到它们,它就像 0: N,N,N...
-
@user2963701 这个位:
grouped[person].values在 0.13rc 中提高。 -
@alko 是的,它“工作”,但没有记录/不受支持,升级后将无法工作 - 在未来的任何时间!