【发布时间】:2016-03-03 23:20:41
【问题描述】:
我想并行化一个脚本。我知道一口 gnu-parallel,但也许它并不适合我的问题。 我有几个 GFF 输入文件(列由表格分隔),我想为我的脚本并行化它们。所有文件都包含相同的 id。
文件 1:
id1 ...
id2 ...
id2 ...
id3 ...文件 2:
id2 ...
id3 ...
id3 ...
这两个文件是不同的:行数不一样,id 是相同的,但没有必要到处都存在(我找到了这个答案How to make gnu-parallel split multiple input files,但所有输入文件中的行数都是相同的)。我不想连接它们,因为我想保留它们来自哪个数据集的信息。而且我不想更改 GFF 格式。 目前,我正在按 id 拆分文件并运行我的脚本。我需要将所有 id1 放在一起(id2 放在一起等),但我的脚本可以同时使用多个 id。而且我不需要运行 File1 id1 - File2 id2 组合,只需 File1 id1、File1 id2 - File2 id2 等。有时一个 id 没有很多数据,它可以与其他 id 一起运行(run1:File1 id1,File1 id2 - File2 id2 ; run2 : File1 id3 - File2 id3 等)。那么是否可以通过根据每个组的 id 和数据量创建一些组来有效地拆分我的输入数据?
谢谢
【问题讨论】:
标签: parallel-processing gnu-parallel