案例库 · 研发与科研 · 技术决策 · 1998–2006
HDF5重建科学数据格式,应对大型并行数据集,并取得胜利
NCSA的HDF5(1998年)保留了HDF的自描述文件,但增加了64位大小和并行I/O;它成为科学界的标准。
NCSA · The HDF Group
那一手
分层数据格式始于20世纪80年代的NCSA,作为一种在不同计算平台之间以自描述文件形式传递科学数据的方式。但到20世纪90年代末,HDF4遇到了限制:文件大小上限为2GB,数据模型类不一致,且没有真正的并行I/O。
1998年9月,NCSA发布了HDF5测试版:一个带有64位地址空间、围绕数据集、空间、类型、组和文件构建的简化对象模型,以及使用MPI-IO的有效并行I/O的新实验版本。源代码免费提供,库大小约为HDF4的三分之一。
HDF5保留了HDF的核心思想——一种可移植、自描述的文件,元数据随数据一起传输;如今,The HDF Group以BSD风格许可维护它,作为一套高性能存储套件,从笔记本电脑到大规模并行系统均可运行,在天文学、地球科学、基因组学和金融等领域有700多个GitHub项目。
为什么管用
- 自描述文件意味着数据可以跨平台、跨团队携带其自身含义。
- 64位寻址和并行I/O适应了即将到来的大规模科学计算。
- 开源许可消除了采用的所有障碍。
- 更简单的对象模型使格式更易于实现和扩展。
值了多少重新设计格式,保留自描述的理念利落
可以搬走什么
当旧格式达到极限时,应重新设计模型而不是修补:更清晰的对象模型加上开源代码,正是让一种格式服务数十年数据的原因。
后来呢
HDF5成为科学计算和工业领域的常客,从天文学、地球科学到基因组学和金融,以BSD风格许可维护,并拥有庞大的库和工具生态系统;该格式继续发展,以适应百亿亿次系统和工作负载。
资料来源
发现哪里写错了?告诉我们。