RefSeq数据库,即RefSeq参考序列
数据库,美国国家生物信息技术中心(
NCBI)提供的具有生物意义上的非冗余的基因和蛋白质序列。
美国国家生物信息技术中心(NCBI)提供了具有生物意义上的非冗余的基因和蛋白质序列的RefSeq参考序列数据库。然而,由于基因普遍存在的多态性以及不同实验室对于序列测定的质量控制存在差异等原因,已发现RefSeq数据库可能存在部分质量问题。文章基于“中心法则”提出“标准转录数据集”的概念,以人类基因和基因组序列为例,利用BLAT、Sim4和自行设计的Elparser等基因结构解析程序分析了RefSeq人类基因转录数据(2005-4-18)与所公布的人类标准基因组(2005-4-20)的对应关系。对于有实验证据支持的标记为NM_和NR_的记录,多种程序分析结果表明,其与标准基因组完全相对应的记录为9771个;符合多个程序修订标准的记录有10943个;而与标准基因组有较大差异的记录为203个,多种程序分析结果不一致的记录为2676个,提示研究人员在使用此非标准转录组数据时,必须考虑到其存在非标准转录的原因甚至存在错误的可能性。此文为基于标准、高质量转录数据集的生物信息学数据分析、分子生物学实验设计、基因多样性和遗传变异分析等提供了重要的参考标准。
其与INSDC(International Nucleotide Sequence Database Collaboration)的不同在于:INSDC是来源于用户提交的序列。而Refseq是由NCBI科研人员与一些机构合作,从INSDC中挑选出质量高的序列构成。