AI把人类DNA的90亿种“变化”算了一遍,会发生什么?
如果把人类DNA想象成一本说明书,它大约由30亿个“字母”写成,每个位置是A、T、C、G中的一个。
如果把其中每一个位置,都分别换成另外三个字母,会产生多少种可能?
答案大约是:
30亿 × 3 = 90亿种。
过去,要把这些可能性逐一拿到实验室验证,几乎是不可能完成的任务。
01|AI把90亿种DNA“变化”算了一遍
9月8日,Google DeepMind发布了 AlphaGenome Atlas:利用AI,对人类基因组中约90亿种可能的单字母变化,也就是单碱基替换,预先计算其可能造成的分子影响。
这里需要先划清边界。
这90亿并不是“人类所有可能的DNA变化”,更复杂的插入、缺失和大片段结构变化并不包含在这个数字里;它也不是90亿个人的DNA,更不是AI已经算出了某个人未来会得什么病。
真正值得关注的是:
AI算完这些可能性以后,并没有把结果扔掉。
它们被保存下来,变成了一套可以反复查询的科学数据资源。
02|这和普通人有什么关系?
做过基因测序,并不等于就能知道哪一个变化真正和疾病有关。
面对一个未解决的罕见病病例,研究人员往往需要从大量候选遗传变异中,一层层筛选真正值得进一步调查的对象。
DeepMind披露了一个例子。
研究人员借助AlphaGenome Atlas的变异影响评分,在罕见病研究中发现了一个影响 DNM1 基因的变异。DNM1与癫痫性脑病高度相关。
更重要的是,AlphaGenome进一步预测:这个变异可能制造一个错误的RNA剪接位点,从而改变最终形成的蛋白质。
随后进行的实验筛查验证了这一预测。
它的价值并不是:
“AI诊断出了疾病。”
而是帮助科学家更快回答:
在这么多可能性里,哪些最值得优先做实验?
预测帮助缩小范围,真正的科学结论仍然需要实验和临床证据。
DeepMind也明确说明,AlphaGenome并未经过临床用途验证,也没有获批用于临床诊断或治疗。
03|90亿种预测,为什么最后变成了1PB?
如果AI只是给90亿种变化分别打一个“有影响”或者“没影响”的标签,数据不会这么大。
实际上,每一种变异背后,都包含大量不同维度的预测:
它可能怎样影响基因表达?
会不会改变RNA剪接?
是否影响染色质的开放状态?
在不同细胞、组织中又可能有什么差异?
这些预测累积起来,AlphaGenome Atlas最终形成了一个约 1PB 的数据集。
DeepMind称,它的数据规模超过AlphaFold Database的30倍。
接下来就出现了一个很有意思的问题:
为什么不等科学家真正需要某一个结果时,再重新计算?
因为这些结果会被不同科研团队反复使用。
DeepMind已经把Atlas做成网站和API,科研人员可以直接查询已经计算好的结果,而不必每次都重新运行模型。
这改变了一件事情:
对于计算成本高、复用价值大的结果,保存数据,也是在保存已经完成的计算成果。
计算一次,很多人重复使用。
04|AI正在产生一种新的科学数据
过去,我们比较熟悉的科学数据,大多来自现实世界。
望远镜观察宇宙;
显微镜观察细胞;
测序仪读取DNA;
传感器记录设备和环境。
大致是:
现实世界 → 仪器 → 数据 → 人或AI进行分析。
AlphaGenome Atlas则展示了另一条链路:
已有科学数据 → AI大规模计算 → 新的预测结果 → 数据库 → 科研人员再次利用。
也就是说,AI不再只是分析已有数据。
它的计算结果本身,也开始变成一种可以反复查询、共享和研究的衍生科学数据资源。
AlphaFold其实已经展示过类似路径。
AI预测出来的大量蛋白质三维结构,被集中做成数据库以后,已经变成全球科研人员可以直接使用的基础资源。
AlphaGenome Atlas进一步说明:
AI正在给科学世界增加新的“信息层”。
05|AI算出来的数据,都值得一直留着吗?
当然不是。
训练时产生的临时缓存、可以很快重新计算的中间文件、复用价值很低的检查点,没有必要全部长期保存。
真正更值得留下来的,通常是另一类数据:
正式发布的数据集、重新计算代价较高的成果、大量研究人员都会调用的数据,以及论文复现和后续研究所依赖的关键版本。
所以,AI数据越来越多以后,真正的问题不会只是:
“容量还够不够?”
而会变成:
“什么值得留?”
这个判断其实已经进入我国科研数据管理体系。
国务院办公厅印发的《科学数据管理办法》把用于科学研究的原始数据及其衍生数据都纳入科学数据范畴;在办法适用范围内,有关科研院所、高校、企业等法人单位作为责任主体,应按照相关标准开展科学数据加工整理和长期保存,并配备相应的存储、管理、服务和安全设施。重要科学数据还需要建立容灾备份机制。
换句话说,长期保存不是简单地“多买一些容量”。
它还关系到版本、来源、安全、共享和多年以后的再次使用。
06|当AI开始“制造数据”,存储也要重新分工
海量科研数据不会都住在同一种存储里。
正在进行训练和分析的数据,需要高性能、低延迟;
近期仍要频繁调用的数据,需要保持在线;
而正式发布的数据集、历史版本,以及多年以后仍有科研价值但平时很少访问的数据,则更适合进入长期存储层。
所以SSD、HDD、磁带、光存储之间,并不是简单的谁替代谁。
它们更像是数据生命周期里的不同岗位。
磐基光忆采用SSD、HDD、BD多介质融合的思路,也是基于这样的逻辑:让不同访问频率和生命周期的数据进入更适合自己的存储层,再通过统一文件系统维持数据整体的访问和管理能力。
这里真正重要的,不是哪一种介质赢了。
而是:
高性能资源,应该留给真正需要高性能的数据。
过去,我们习惯保存实验和观测留下来的结果。
而现在,越来越多有长期价值的数据,也可能直接来自AI的大规模计算。
AlphaGenome Atlas的1PB数据只是一个开始。
当AI进入科学研究,人类需要长期保存的,可能不只是我们观察到的事实,也包括机器计算出来的可能性。
资料来源
- Google DeepMind:《AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome》,2026年9月8日——AlphaGenome Atlas 发布、约90亿种单碱基替换、约1PB数据规模、疾病研究案例及使用边界。
- Google DeepMind / Nature:AlphaGenome 相关研究与论文——AlphaGenome模型能力、DNA变异效应预测及科学研究应用。
- AlphaFold Protein Structure Database(EMBL-EBI)——AI预测结果形成可重复查询科学数据资源的代表性案例。
- 国务院办公厅:《科学数据管理办法》——科学数据采集生产、加工整理、长期保存、共享利用及安全管理等要求。
- Harvard FAS Research Computing:Data Storage——科研数据在高性能存储、长期存储等不同层级之间进行分层管理的实践参考。
