打开APP
userphoto
未登录

开通VIP,畅享免费电子书等14项超值服

开通VIP
【T】每日一生信
 Fastq格式里的reads质量得分编码方式有好几种,现在Illumina用的一般是Phred33,但偶尔还会遇到Phred64(旧版本)的。附件里的perl脚本可以把质量得分以数字的形式打印出来,并帮助判断是Fastq32格式还是Phred64。
    
   FASTQ是基于文本的,保存生物序列(通常是核酸序列)和其测序质量信息的标准格式。其序列以及质量信息都是使用一个ASCII字符标示,最初由Sanger开发,目的是将FASTA序列与质量数据放到一起,目前已经成为高通量测序结果的事实标准。FASTQ格式的序列一般都包含有四行,第一行由'@'开始,后面跟着序列的描述信息,这点跟FASTA格式是一样的。第二行是序列。第三行由'+'开始,后面也可以跟着序列的描述信息。第四行是第二行序列的质量评价(qualityvalues,注:应该是测序的质量评价),字符数跟第二行的序列是相等的。
例子:
@FCC0U6BACXX:6:1101:1418:2067#CTAGTTAT/1
CCGGTAAAGGATCGTATCCTGCGTGCACGATGGCGGTATTTGCGCTGGATACACCCATCCCAATATCAGCTGCTTTATCGATCAACAAGA
+
abbecceegggggiihhhfgihiifhhiihiiiihiZafgffhihg]aabdedddcab^ac`bcbb_]`bcccR]SSYSWQ[JT]`_^X[
6flowcell lane
1101tile number within the flowcell lane
1418‘x’-coordinate of the cluster within the tile
2067‘y’-coordinate of the cluster within the tile
#CTAGTTATindex number for a multiplexed sample (0 for no indexing)
/1the member of a pair, /1 or /2 (paired-endor mate-pair reads only)
关于质量编码格式
质量评分指的是一个碱基的错误概率的对数值。其最初在Phred拼接软件中定义与使用,其后在许多软件中得到使用。其质量得分与错误概率的对应关系见下表:
Phred quality scores are logarithmically linked to errorprobabilities
PHRED QUALITY SCORE PROBABILITY OF INCORRECT BASE CALL BASECALL ACCURACY
10                    1 in 10                      90 %
20                    1 in 100                       99 %
30                    1 in 1000                      99.9 %
40                    1 in 10000                99.99%
50                    1 in 100000               99.999 %
Phred quality scores Q are defined as a property which islogarithmically related to the base-calling error probabilitiesP.
Q=-10log10P
对于每个碱基的质量编码标示,不同的软件采用不同的方案,目前有5种方案:
Sanger,Phred qualityscore,值的范围从0到92,对应的ASCII码从33到126,但是对于测序数据(raw readdata)质量得分通常小于60,序列拼接或者mapping可能用到更大的分数。
Solexa/Illumina 1.0, Solexa/Illumina qualityscore,值的范围从-5到63,对应的ASCII码从59到126,对于测序数据,得分一般在-5到40之间;
Illumina 1.3+,Phred qualityscore,值的范围从0到62对应的ASCII码从64到126,低于测序数据,得分在0到40之间;
Illumina 1.5+,Phred qualityscore,但是0到2作为另外的标示,详见http://solexaqa.sourceforge.net/questions.htm#illumina
Illumina 1.8+

最重要的是通过下面的这个脚本,我知道了我的测序采用的是phred64这个编码。


参考资料:
jiewencai的个人博客  http://blog.sciencenet.cn/blog-630246-709629.html
博耘生物           http://boyun.sh.cn/bio/?p=1901
维基百科           http://en.wikipedia.org/wiki/FASTQ_format
本站仅提供存储服务,所有内容均由用户发布,如发现有害或侵权内容,请点击举报
打开APP,阅读全文并永久保存 查看更多类似文章
猜你喜欢
类似文章
【热】打开小程序,算一算2024你的财运
NGS数据格式梳理01-FASTQ和FASTA格式详解
NGS 数据过滤之 Trimmomatic 详细说明
FastQC评估测序数据的质量
fastq格式文件处理大全(一)
读懂测序文件那些事儿
文件格式——fastq格式
更多类似文章 >>
生活服务
热点新闻
分享 收藏 导长图 关注 下载文章
绑定账号成功
后续可登录账号畅享VIP特权!
如果VIP功能使用有故障,
可点击这里联系客服!

联系客服