【发布时间】:2012-02-08 16:34:31
【问题描述】:
我有一个以空格分隔的文件,如下所示:
probeset_id submitted_id chr snp_pos alleleA alleleB 562_201 562_202 562_203 562_204 562_205 562_206 562_207 562_208 562_209 562_210 562_211 562_212 562_213 562_214 562_215 562_216 562_217 562_218 562_219 562_220 562_221 562_222 562_223 562_224 562_225 562_226 562_227 562_228 562_229 562_230 562_231 562_232 562_233 562_234 562_235 562_236 562_237 562_238 562_239 562_240 562_241 562_242 562_243 562_244 562_245 562_246 562_247 562_248 562_249 562_250 562_251 562_252 562_253 562_254 562_255 562_256 562_257 562_258 562_259 562_260 562_261 562_262 562_263 562_264 562_265 562_266 562_267 562_268 562_269 562_270 562_271 562_272 562_273 562_274 562_275 562_276 562_277 562_278 562_279 562_280 562_281 562_283 562_284 562_285 562_289 562_291 562_292 562_294 562_295 562_296 562_400 562_401 562_402 562_403 562_404 562_405
AX-75448119 Chr1_41908741 1 41908741 T C 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 1 0 0 0 1 1 1 1 1 1 0 1 0 0 0 0 2 2 0 0 0 0 0 1 0 0 0 0 0
AX-75448118 Chr1_41908545 1 41908545 T A 2 2 2 2 2 2 2 2 2 0 0 0 0 0 0 0 0 0 0 0 1 2 2 2 2 2 2 2 2 2 0 0 0 0 0 1 1 0 1 1 0 0 0 0 0 0 1 2 2 2 0 1 1 1 2 -1 1 2 0 0 2 1 1 0 1 0 1 2 1 0 0 1 2 2 1 2 2 0 1 2 2 2 2 2 2 0 1 0 0 0 1 2 2 2 2 0
我想根据第 5 列和第 6 列用字母替换数字
- 将
0替换为$5 $5(第5 列重复两次)例如,如果第5 列是T,则将0替换为T T - 将
2替换为$6 $6(第6 列重复两次)例如,如果第6 列是C,则将2替换为C C - 将
1替换为$5 $6例如,如果第5 列和第6 列分别为T和C,则将1替换为T C - 将
-1替换为? ?
需要注意的是,第 5 列和第 6 列可以是 T、A、C 和 G
所以我想要输出的是:
AX-75448119 Chr1_41908741 1 41908741 T C T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T T C T T T T T T T C T C T C T C T C T C T T T C T T T T T T T T C C C C T T T T T T T T T T T C T T T T T T T T T T
AX-75448118 Chr1_41908545 1 41908545 T A A A A A A A A A A A A A A A A A A A T T T T T T T T T T T T T T T T T T T T T T T A A A A A A A A A A A A A A A A A A A T T T T T T T T T T T A T A T T T A T A T T T T T T T T T T T T T A A A A A A A T T T A T A T A A A ? ? T A A A T T T T A A T A T A T T T A T T T A A A T A T T T T T A A A A A T A A A A A T T T A A A A A A A A A A A A A T T T A T T T T T T T A A A A A A A A A T T
我不知道这是否可以通过 awk 实现!如果不是,我会在 python 中尝试,但我更喜欢像 awk 这样的 Linux 命令(它比 python 快得多,因为我使用的文件有 120 万行,我的计算机可以通过 python 交换!)
【问题讨论】:
-
请贴出你目前所写的代码。这不是“为 me.com 做我的工作”。你试过什么?
-
我用'sed'尝试了mayn的东西,但它不起作用!我只是想知道可以使用的命令,然后我可以自己尝试一下!
-
是什么让你觉得 awk 会比 python 快?
-
您的样本输出与您的规格不符。第二行的一堆“A”从哪里来的?
-
@mahmood:(1) 请更新问题以回答 cmets。 (2) 请不要在 cmets 中发布代码,请用代码更新问题。