gpt4 book ai didi

LINUX AWK命令合并基因亚型

转载 作者:塔克拉玛干 更新时间:2023-11-03 01:51:41 24 4
gpt4 key购买 nike

我有一个以下格式的大文件:

chr1    11873   12227   DDX11L1 .   +
chr1 12612 12721 DDX11L1 . +
chr1 13220 14409 DDX11L1 . +
chr1 14361 14829 WASH7P . -
chr1 14969 15038 WASH7P . -
chr1 15795 15947 WASH7P . -
chr1 16606 16765 WASH7P . -
chr1 16857 17055 WASH7P . -
chr1 17232 17368 WASH7P . -
chr1 17368 17436 MIR6859-2 . -
chr1 17368 17436 MIR6859-1 . -
chr1 17605 17742 WASH7P . -
chr1 17914 18061 WASH7P . -
chr1 18267 18366 WASH7P . -
chr1 24737 24891 WASH7P . -
chr1 29320 29370 WASH7P . -
chr1 34610 35174 FAM138A . -
chr1 34610 35174 FAM138F . -
chr1 35276 35481 FAM138A . -
chr1 35276 35481 FAM138F . -
chr1 35720 36081 FAM138A . -
chr1 35720 36081 FAM138F . -
chr1 69090 69093 OR4F5 . +
chr1 69090 70005 OR4F5 . +
chr1 69090 70008 OR4F5 . +
chr1 70005 70008 OR4F5 . +
chr1 134772 139696 LOC729737 . -
chr1 139789 139847 LOC729737 . -

我想合并一个基因的所有亚型(第 4 列)的坐标。如果第四列中的值在列中相同,我想要第一个匹配行的第 2 列中的值和最后一个匹配行中的第 3 列的值。所以输出将变为。

chr1    11873   14409   DDX11L1 .   +
chr1 14361 29370 WASH7P . -
chr1 17368 17436 MIR6859-2 . -
chr1 17368 17436 MIR6859-1 . -
chr1 34610 36081 FAM138A . -
chr1 34610 36081 FAM138F . -
chr1 69090 70008 OR4F5 . +
chr1 134772 139847 LOC729737 . -

提前致谢,期待积极的回应。

最佳答案

使用这个awk:

awk '!a[$4]{b[i++]=$0} {a[$4]=$3} END{for(i in b){$0=b[i];$3=a[$4];print}}' file
  • !a[$4]:应用于第 4 个字段最先出现的每一行
    • b[i++]=$0:在这种情况下,用这些行填充数组 b
  • {a[$4]=$3} 适用于每一行。数组 a 填充了第三个字段,完成后存储第三个字段的最后值。
  • END{...} 将在处理完所有行后执行
    • for(i in b) 遍历数组 b
    • $0=b[i] 设置 $0 变量
    • $3=a[$4] 第三个字段应该是最后一次出现
    • print 打印行

输出:

chr1 11873 14409 DDX11L1 . +
chr1 14361 29370 WASH7P . -
chr1 17368 17436 MIR6859-2 . -
chr1 17368 17436 MIR6859-1 . -
chr1 34610 36081 FAM138A . -
chr1 34610 36081 FAM138F . -
chr1 69090 70008 OR4F5 . +
chr1 134772 139847 LOC729737 . -

如果你想要它列,使用这个:

awk ... | column -t

关于LINUX AWK命令合并基因亚型,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/33038744/

24 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com