ai设计出了一把自然界从未出现过的基因剪刀。
而且,其性能超越了历经数十亿年进化锤炼的天然版本。
7月16日,《Nature》发布消息:科研团队借助AI成功构建出自然界中完全不存在的CRISPR酶,其基因切割效率显著高于“原生版本”。相关论文同步发表于《Science》。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

领衔这项研究的,正是2020年因CRISPR技术荣膺诺贝尔化学奖的Jennifer Doudna。
她曾向《Nature》坦言:“蛋白质可以被修改。但一旦动手调整,它几乎立刻失去功能。”
这一难题困扰科学界长达十余年。
而AI的介入,使得蛋白序列被改动近三成后,该酶仍能保持活性与功能。
这仅是其中一条技术路径。
另一条路径上,初创企业Profluent跳过TnpB,直接从头生成全新Cas9蛋白。
结果同样亮眼:目标位点切割更高效,非目标区域几乎零误切,脱靶编辑率较当前主流SpCas9下降约95%。
数十亿年自然演化所产出的分子工具,正被AI在广阔的序列空间中重新定义与重构。

Jennifer Doudna,加州大学伯克利分校生物化学教授,2020年诺贝尔化学奖得主,创新基因组研究所创始人。(图源:Jussi Puikkonen/KNAW)
改动30%仍可运作,为何如此颠覆常识?
CRISPR并非人类原创。
无论是Cas9还是Cas12,均源自细菌体内天然存在的防御系统组件。
细菌利用这些蛋白抵御病毒侵袭;人类则敏锐捕捉到其机制潜力,将其引入实验室——搭配一段引导RNA,即可实现对人类基因组30亿碱基中特定位置的精准切割,堪称“分子级手术刀”。
诺奖授予Doudna与Charpentier,核心在于“发现”,而非“设计”。
但矛盾也由此产生:借来的“零件”,尺寸、稳定性、特异性等参数,并非为人类实验需求量身定制。若想获得更小体积、更高精度、更低免疫原性或更广靶向范围的编辑器,只能依赖人工定向改造。
然而这条路异常艰难。
典型Cas9蛋白通常含超1000个氨基酸,理论上可能的序列组合高达20¹⁰⁰⁰种——这个数字远超可观测宇宙中原子总数的多个数量级。
在此浩瀚空间中,真正具备功能的序列极其稀疏,人类所能尝试的范围微乎其微。
因此,此前已有若干AI辅助蛋白优化工作,但改动幅度普遍控制在1%–2%以内。
稍作激进调整,蛋白即失活。
AI落子的两个关键步骤
Doudna团队此次聚焦的对象并非Cas9,而是名为TnpB的一类微型核酸酶。
这类酶体型更紧凑,且在进化谱系中被视为Cas12的远古祖先。
团队的核心问题是:这段蛋白序列究竟可被改写至何种程度,仍能维持其基因编辑能力?
第一步,交由AI模型完成。
研究人员将某型TnpB的目标三维结构(即蛋白正确折叠后的形态)输入模型,并反向提问:
“哪些氨基酸序列,能确保蛋白最终折叠成该结构?”
模型输出数千种可行方案。
但这仅解决了“形似”问题——结构正确,并不等于功能健全。
于是进入第二步:训练另一AI模型,全面整合实验室多年积累的海量实测数据,从中学习蛋白各结构域之间精微的协同关系。
具体而言,识别哪些区域属于不可触碰的“功能核心区”,哪怕单点突变也可能导致整体失效。

Doudna团队TnpB设计流程示意图。左下为系统发育树,蓝色代表自然界已知TnpB序列,红色簇为AI生成序列,二者几乎无重叠。右下为技术路线:以AlphaFold2预测结构为基础,叠加进化约束掩码,输入ESM-IF1模型生成新序列。(图源:Science 2026,DOI: 10.1126/science.aed6123)
双模型协同筛选后,一批人工合成核酸酶脱颖而出。
经标准功能验证,它们不仅能在细菌中实现编辑,在植物及人类细胞中亦表现稳定。
其中部分变体对目标片段的插入/删除效率,甚至超过天然TnpB版本。
Doudna评价该成果时称:“非常令人振奋。”
403处变异,这把剪刀在自然界毫无亲缘
前文提及的第一组关键数据:AI生成版本约30%的氨基酸序列与天然版本不同,而此前同类AI工作的平均改动幅度仅为1%–2%。
第二组数据来自蛋白设计公司Profluent,其选择另辟蹊径——不改造TnpB,而是从零构建全新Cas9。
团队系统挖掘了26TB规模的基因组与宏基因组数据,构建涵盖510万个CRISPR-Cas蛋白的庞大数据库,再依托蛋白语言模型进行大规模序列生成,所得多样性达自然界已知水平的4.8倍。

AI生成序列(浅色)相较天然CRISPR蛋白(深色)的多样性扩张效果,按蛋白簇数量统计。热图显示各蛋白家族在不同CRISPR-Cas系统中的分布情况。(图源:Profluent)
从中筛选48条候选序列送入人类细胞开展功能测试,最优者被命名为OpenCRISPR-1,并已开源共享。
其实验表现如下:
靶向编辑效率达55.7%,SpCas9为48.3%;
脱靶编辑率低至0.32%,SpCas9为6.1%;
后者降幅约为95%。
该序列与SpCas9存在403处差异,与数据库中任一已知天然CRISPR蛋白亦相差至少182处。
这是真正意义上,依照“基因剪刀”的功能定义,全新创造的一把地球生命史上从未存在过的分子工具。

多款AI生成核酸酶(绿色,深绿为OpenCRISPR-1)在靶向活性上媲美或超越SpCas9(蓝色),同时脱靶活性大幅降低。(图源:Profluent)
OpenCRISPR-1的数据源于该公司公开研究报告,独立复现实验尚待时间验证。
而Doudna团队的成果已通过《Science》同行评议。
从“解读自然”迈向“塑造自然”
唯有将两条技术路径并置观察,方能真正理解变革的本质。
AlphaFold解决的是“这段序列会折叠成什么样子”:即结构预测,属于认知层面。
蛋白语言模型则向前推进一步:揭示“哪些序列能维持活性”,挖掘内在功能逻辑。
如今第三阶段已然开启:凭空生成自然界从未出现过的全新序列,并使其在真实活细胞中稳定执行任务。
苏黎世大学分子生物学家Soeren Lienkamp指出:CRISPR让基因编辑成为普适技术,而AI驱动的蛋白设计,则赋予人类在蛋白空间中自主创造全新特性的能力。
熟悉大语言模型的人对此并不陌生——其范式与文本模型学习语言高度一致:
喂入海量序列数据,习得内在“语法”,继而生成训练集中从未出现过的全新“句子”。
反观传统路径,其偶然性昭然若揭:
胰岛素源自犬类组织,Cas9发现于酸奶工厂的细菌样本,肉毒毒素则源于一次食物中毒事件。
所有这些关键工具,无一出自理性设计,几乎全靠机缘巧合。
如今新增一条通路:以目标功能为起点,逆向推导并构造出对应分子。
一个Cas9蛋白通常含超1000个氨基酸,理论序列空间为20¹⁰⁰⁰,远超可观测宇宙原子总数。
自然进化耗时数十亿年才摸索出有限解,AI模型仅需数小时即可遍历探索。
这才是该突破最震撼之处。
只是,编写代码的AI产出运行于虚拟环境,出错可随时回滚;而编写蛋白的AI,其产物直接作用于活体细胞——它所改写的,是真实的遗传信息,而非一次可撤销的程序执行。
这正是它既令人屏息又令人心潮澎湃的根本原因。
能否攻克癌症或延缓衰老?
目前尚不能断言。
文中所述成果均停留在细胞实验阶段,全部验证仍处于基础研究环节。
后续还需经历动物模型试验、临床人体试验、监管审批等多重关卡,每一步都可能耗时数年。
是否意味着AI已全面碾压自然进化?
更准确的说法应是:AI设计的部分蛋白,在特定指标上优于特定天然版本。
这亦非AI蛋白设计的首次亮相。
AlphaFold、RoseTTAFold及各类蛋白语言模型的发展已逾五年,OpenCRISPR-1预印本早在2024年4月便发布于bioRxiv。

其核心意义在于:AI设计的蛋白首次成功嵌入更复杂的生命系统,并完整实现了从设计、合成到功能性基因编辑的闭环验证。
斯坦福大学Le Cong教授曾参与开发早期用于基因治疗的CRISPR工具,他与Doudna观点一致:基于天然核酸酶的基础研究绝不能停止。
AI模型之所以能高速迭代,根基正是过去几十年实验室持续积累的高质量数据。一旦数据供给中断,模型能力也将止步。
Doudna强调:这项工作展现的是AI与生物学融合的未来图景——我们需要AI加速探索进程,但要将模型价值最大化,仍离不开深刻理解分子机制的专业人才。
参考资料:
https://www.php.cn/link/86ba1452780820e4c745f2fb19d4e3a8
https://www.php.cn/link/311add599a282de6edc2ec58fff68e76
https://www.php.cn/link/a6c52c9584dc2af5595d5b8d1952bd84
https://www.php.cn/link/c203f236cf82b0803440f54555fb2392
https://www.php.cn/link/e85db58951ac0067dfbfbd99485bdae0
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。











