案例库 · 研发与科研 · 技术决策 · 1985–1988
FASTA一行式头注使纯文本序列成为生物信息学标准
Lipman和Pearson在1985年推出的FASTA格式,在序列前加一个“>”头注并使用纯文本字母,其简洁性使其成为生物信息学近乎通用的交换格式。
美国国立卫生研究院(NIH)
解法
在20世纪80年代中期,序列数据以各种与程序或数据库绑定的格式大量积累,导致很难在不同工具间转移序列。William Pearson和David Lipman的FASTA搜索程序附带了一种简单到不可能混淆的格式:以“>”开头的一行承载序列的名称和描述,其后的每一行都是单字母编码的序列本身。
格式规则保持极简。NIH下属的GenBank将defline定义为“>”后接一个唯一SeqID和可选的来源修饰符,而序列本身可以跨行,且只能使用IUPAC字母。由于整个文件是纯文本,解析它只需一个行读取器——格式文档指出这种简洁性使得使用文本处理工具操纵序列变得容易。
近乎为零的采用成本立下了功劳。FASTA成为生物信息学中近乎通用的标准,被主要序列档案库接受用于数据库搜索和提交,后来的格式如FASTQ直接在它的约定上构建,而非取代它。
生效的原因
- 纯ASCII意味着任何文本工具都能读写它
- 单个“>”头注行携带了每个数据库所需的标识符
- 它附带了功能可用的FASTA搜索软件,因此采用无需单独推广
- NCBI和其他公共档案库接受它作为提交输入
取得的成效一个“>”头注加上纯文本字母使得序列易于共享利落
可借鉴之处
一种格式在采用成本趋近于零时获胜:如果像行读取器这样简单的工具就能解析它,那么无需任何说服,采用自然会扩散。
后续进展
FASTA仍然是数据库搜索和提交的默认格式,其约定被扩展用于测序读长的FASTQ格式。它还孕育了一系列FASTA比对程序,至今仍用于相似性搜索。
资料来源
发现哪里写错了?告诉我们。