AI把人类DNA的90亿种“变化”算了一遍,会发生什么?

如果把人类DNA想象成一本说明书,它大约由30亿个“字母”写成,每个位置是A、T、C、G中的一个。

如果把其中每一个位置,都分别换成另外三个字母,会产生多少种可能?

答案大约是:

30亿 × 3 = 90亿种。

过去,要把这些可能性逐一拿到实验室验证,几乎是不可能完成的任务。

01|AI把90亿种DNA“变化”算了一遍

9月8日,Google DeepMind发布了 AlphaGenome Atlas:利用AI,对人类基因组中约90亿种可能的单字母变化,也就是单碱基替换,预先计算其可能造成的分子影响。

这里需要先划清边界。

这90亿并不是“人类所有可能的DNA变化”,更复杂的插入、缺失和大片段结构变化并不包含在这个数字里;它也不是90亿个人的DNA,更不是AI已经算出了某个人未来会得什么病。

真正值得关注的是:

AI算完这些可能性以后,并没有把结果扔掉。

它们被保存下来,变成了一套可以反复查询的科学数据资源。

02|这和普通人有什么关系?

做过基因测序,并不等于就能知道哪一个变化真正和疾病有关。

面对一个未解决的罕见病病例,研究人员往往需要从大量候选遗传变异中,一层层筛选真正值得进一步调查的对象。

DeepMind披露了一个例子。

研究人员借助AlphaGenome Atlas的变异影响评分,在罕见病研究中发现了一个影响 DNM1 基因的变异。DNM1与癫痫性脑病高度相关。

更重要的是,AlphaGenome进一步预测:这个变异可能制造一个错误的RNA剪接位点,从而改变最终形成的蛋白质。

随后进行的实验筛查验证了这一预测。

它的价值并不是:

“AI诊断出了疾病。”

而是帮助科学家更快回答:

在这么多可能性里,哪些最值得优先做实验?

预测帮助缩小范围,真正的科学结论仍然需要实验和临床证据。

DeepMind也明确说明,AlphaGenome并未经过临床用途验证,也没有获批用于临床诊断或治疗。

03|90亿种预测,为什么最后变成了1PB?

如果AI只是给90亿种变化分别打一个“有影响”或者“没影响”的标签,数据不会这么大。

实际上,每一种变异背后,都包含大量不同维度的预测:

它可能怎样影响基因表达?

会不会改变RNA剪接?

是否影响染色质的开放状态?

在不同细胞、组织中又可能有什么差异?

这些预测累积起来,AlphaGenome Atlas最终形成了一个约 1PB 的数据集。

DeepMind称,它的数据规模超过AlphaFold Database的30倍。

接下来就出现了一个很有意思的问题:

为什么不等科学家真正需要某一个结果时,再重新计算?

因为这些结果会被不同科研团队反复使用。

DeepMind已经把Atlas做成网站和API,科研人员可以直接查询已经计算好的结果,而不必每次都重新运行模型。

这改变了一件事情:

对于计算成本高、复用价值大的结果,保存数据,也是在保存已经完成的计算成果。

计算一次,很多人重复使用。

04|AI正在产生一种新的科学数据

过去,我们比较熟悉的科学数据,大多来自现实世界。

望远镜观察宇宙;

显微镜观察细胞;

测序仪读取DNA;

传感器记录设备和环境。

大致是:

现实世界 → 仪器 → 数据 → 人或AI进行分析。

AlphaGenome Atlas则展示了另一条链路:

已有科学数据 → AI大规模计算 → 新的预测结果 → 数据库 → 科研人员再次利用。

也就是说,AI不再只是分析已有数据。

它的计算结果本身,也开始变成一种可以反复查询、共享和研究的衍生科学数据资源。

AlphaFold其实已经展示过类似路径。

AI预测出来的大量蛋白质三维结构,被集中做成数据库以后,已经变成全球科研人员可以直接使用的基础资源。

AlphaGenome Atlas进一步说明:

AI正在给科学世界增加新的“信息层”。

05|AI算出来的数据,都值得一直留着吗?

当然不是。

训练时产生的临时缓存、可以很快重新计算的中间文件、复用价值很低的检查点,没有必要全部长期保存。

真正更值得留下来的,通常是另一类数据:

正式发布的数据集、重新计算代价较高的成果、大量研究人员都会调用的数据,以及论文复现和后续研究所依赖的关键版本。

所以,AI数据越来越多以后,真正的问题不会只是:

“容量还够不够?”

而会变成:

“什么值得留?”

这个判断其实已经进入我国科研数据管理体系。

国务院办公厅印发的《科学数据管理办法》把用于科学研究的原始数据及其衍生数据都纳入科学数据范畴;在办法适用范围内,有关科研院所、高校、企业等法人单位作为责任主体,应按照相关标准开展科学数据加工整理和长期保存,并配备相应的存储、管理、服务和安全设施。重要科学数据还需要建立容灾备份机制。

换句话说,长期保存不是简单地“多买一些容量”。

它还关系到版本、来源、安全、共享和多年以后的再次使用。

06|当AI开始“制造数据”,存储也要重新分工

海量科研数据不会都住在同一种存储里。

正在进行训练和分析的数据,需要高性能、低延迟;

近期仍要频繁调用的数据,需要保持在线;

而正式发布的数据集、历史版本,以及多年以后仍有科研价值但平时很少访问的数据,则更适合进入长期存储层。

所以SSD、HDD、磁带、光存储之间,并不是简单的谁替代谁。

它们更像是数据生命周期里的不同岗位。

磐基光忆采用SSD、HDD、BD多介质融合的思路,也是基于这样的逻辑:让不同访问频率和生命周期的数据进入更适合自己的存储层,再通过统一文件系统维持数据整体的访问和管理能力。

这里真正重要的,不是哪一种介质赢了。

而是:

高性能资源,应该留给真正需要高性能的数据。

过去,我们习惯保存实验和观测留下来的结果。

而现在,越来越多有长期价值的数据,也可能直接来自AI的大规模计算。

AlphaGenome Atlas的1PB数据只是一个开始。

当AI进入科学研究,人类需要长期保存的,可能不只是我们观察到的事实,也包括机器计算出来的可能性。

资料来源

  1. Google DeepMind:《AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome》,2026年9月8日——AlphaGenome Atlas 发布、约90亿种单碱基替换、约1PB数据规模、疾病研究案例及使用边界。
  2. Google DeepMind / Nature:AlphaGenome 相关研究与论文——AlphaGenome模型能力、DNA变异效应预测及科学研究应用。
  3. AlphaFold Protein Structure Database(EMBL-EBI)——AI预测结果形成可重复查询科学数据资源的代表性案例。
  4. 国务院办公厅:《科学数据管理办法》——科学数据采集生产、加工整理、长期保存、共享利用及安全管理等要求。
  5. Harvard FAS Research Computing:Data Storage——科研数据在高性能存储、长期存储等不同层级之间进行分层管理的实践参考。