samtools faidx输出的fai文件格式解析 | fasta转bed | fasta to bed

fai示例:

1
2
3
4
5
6
Sc0000003       2774837 10024730        60      61
Sc0000004       2768176 12845826        60      61
Sc0000005       2756750 15660150        60      61
Sc0000006       2627294 18462857        60      61
Sc0000007       2472379 21133951        60      61
Sc0000008       2452568 23647548        60      61

  

1
2
3
4
5
NAME    Name of this reference sequence
LENGTH  Total length of this reference sequence, in bases
OFFSET  Offset within the FASTA file of this sequence's first base
LINEBASES   The number of bases on each line
LINEWIDTH   The number of bytes in each line, including the newline

http://www.htslib.org/doc/faidx.html

offset比较让人费解,其实就是 bytes starting from zero,文件层次的属性,一般不需要关注。

 

有时需要将fasta转为bed,就是统计长度就好了,但是利用samtools faidx这个功能,速度奇快,再配合一行Linux命令就搞定。

1
awk '{print $1, 1, $2}' file | sed -e 's/ /\t/g' > out

  

 一个问题:bam,bed,gtf的位置都是从1开始的吗?

posted @   Life·Intelligence  阅读(4033)  评论(0编辑  收藏  举报
(评论功能已被禁用)
编辑推荐:
· 从 HTTP 原因短语缺失研究 HTTP/2 和 HTTP/3 的设计差异
· AI与.NET技术实操系列:向量存储与相似性搜索在 .NET 中的实现
· 基于Microsoft.Extensions.AI核心库实现RAG应用
· Linux系列:如何用heaptrack跟踪.NET程序的非托管内存泄露
· 开发者必知的日志记录最佳实践
阅读排行:
· winform 绘制太阳,地球,月球 运作规律
· AI与.NET技术实操系列(五):向量存储与相似性搜索在 .NET 中的实现
· 超详细:普通电脑也行Windows部署deepseek R1训练数据并当服务器共享给他人
· 【硬核科普】Trae如何「偷看」你的代码?零基础破解AI编程运行原理
· 上周热点回顾(3.3-3.9)
TOP
点击右上角即可分享
微信分享提示