【发布时间】:2018-10-31 02:57:26
【问题描述】:
最近我不得不使用 Python 或 Scala 在 SPARK 上处理 BWA 或其他对齐工具生成的 bam 文件,如何将这个二进制文件转换为 RDD,以便我可以对每个读取序列和其他信息进行一些统计?谁能有一些经验或举个例子?我已经阅读了 PySpark 和 Spark-bam 的 binaryRecords() 函数,似乎效果不佳。
【问题讨论】:
-
欢迎您!这个问题似乎更适合 bioinformatics.stackexchange.com。
标签: python apache-spark bioinformatics