跳到正文
2026 FRONTIER · AI FOR SCIENCE

AI 可以把海量候选缩成少量待验证候选,但最后一公里叫验证

科学模型最强的地方,不是替人宣布结论,而是学习昂贵规律、生成候选、排序实验和寻找可执行算法。只有当输出进入可证伪的模拟、证明、实验与独立复现闭环,‘模型觉得可能’才逐步变成可用知识。

海量蛋白结构、晶体、天气旋涡和几何候选经过 AI 过滤成少量候选,再分别进入形式化检查、计算模拟和实验室验证,并把结果反馈到下一轮。
直觉总览:AI 负责缩小搜索空间,形式化检查、计算模拟与现实实验负责提供不同证据;图中的勾号只表示相应评价器返回了结果,不代表已经跨团队独立复现。 查看原图 ↗
01 · 共同内核

把昂贵世界学成一个便宜近似,再让真实世界挑错

许多科学问题的搜索空间巨大:氨基酸如何折叠、原子怎样排列、未来大气会走哪条轨迹、哪个算法满足约束。直接为每个候选做实验、DFT、数值积分或形式证明太贵,模型就先充当 surrogate model(代理模型)——一个快很多、但可能出错的近似。

PREDICT

从输入预测性质

给定蛋白序列预测结构,给定晶体图预测形成能,给定当前天气预测未来场。输入已知,模型近似昂贵计算或测量。

GENERATE

反过来造候选

给目标性质生成分子、材料、轨迹或算法。生成器能探索人没写过的组合,也会产生化学不可合成、物理不稳定或程序错误的样本。

SELECT

主动选择下一次实验

当不确定性已经按目标事件校准时,系统可把它与价值函数结合,决定“下一笔昂贵预算花在哪”。验证结果回流训练,形成 active learning(主动学习)数据飞轮;未校准的高置信不能直接支配实验预算。

白话例子 · 找新电池材料

模型像海选评委,DFT 像复试,真实合成才是决赛

先让生成或枚举系统提出数百万晶体结构,图网络快速估计稳定性,只把高分或高不确定候选送给昂贵的密度泛函理论计算;计算稳定还不等于能合成,最后要在实验室制备并测量性能。每一层都减少候选,也都可能误杀好材料或放过坏材料。

02 · 四类真实任务

模型架构跟着科学对象走,而不是所有问题都套语言模型

蛋白与分子:一维序列要变成三维相互作用

AlphaFold 2 同时维护 MSA(Multiple Sequence Alignment,多序列比对)与残基对表示,反复交换信息,再由结构模块输出三维坐标。AlphaFold 3 扩到蛋白、核酸、小分子、离子和修饰残基的复合物,并使用 diffusion-based(基于扩散)结构生成。它输出的是结构假设及模型置信信息,不是结合能、药效、安全性和临床成功的总答案;AF3 论文在 PoseBusters 基准上仍报告 4.4% 手性违规,并明确列出碰撞、幻觉与静态结构等限制。

材料:原子与邻近关系天然是一张周期图

GNoME 把元素做节点、邻近关系做边,用消息传递图网络预测晶体总能,再以 VASP(Vienna Ab initio Simulation Package,维也纳第一性原理模拟软件包)的 DFT(Density Functional Theory,密度泛函理论)计算筛选稳定性。论文报告 220 万个相对 Materials Project 稳定的结构,其中 381,000 个新条目位于更新后的凸包;736 个结构与独立实验报告匹配,但这不等于 381,000 次前瞻性合成。动态稳定、可合成性和器件性能仍是后续问题。

天气:不是猜一张图,而是演化全球概率场

GraphCast 学确定性状态演化;GenCast 用条件扩散,从当前与上一时刻状态采样下一时刻,再自回归得到 0.25° 网格、12 小时间隔的 15 天集合轨迹。论文在 2019 年回测中称其 CRPS(Continuous Ranked Probability Score,连续排名概率得分)在 1,320 个变量、时效和高度层组合中的 97.2% 显著优于欧洲中期天气预报中心集合预报(ECMWF ENS);这些组合相互相关,不是 1,320 个独立任务。未来部署仍要持续检验校准、极端事件与观测漂移。

数学与算法:最宝贵的是自动检查器

AlphaGeometry 把神经生成与符号演绎组合,在 30 道奥赛级几何题中解出 25 道;2025 年 AlphaGeometry2 预印本把 2000–2024 年 IMO(International Mathematical Olympiad,国际数学奥林匹克)几何题的语言覆盖率从 66% 提到 88%,并在这 25 年的全部 IMO 几何题上报告 84% 求解率。这里的强证据来自可逐步检查的形式证明,但结论受题目语言与测试集范围约束。AlphaEvolve 同理:LLM(Large Language Model,大语言模型)写程序,编译、测试、目标函数或证明负责判真判优。

03 · 发现闭环

真正可扩展的系统,把失败也变成下一轮数据

只训练一次、输出一批结果,是静态预测服务;科学发现系统更像循环:先写清问题和证据合同,再生成候选、用代理模型筛选,并按任务选择形式化校验、历史回测、计算模拟或现实实验。不同 evaluator(评价器)可以串联,却不是所有任务都必须依次走“计算 → 实验”;最终要把误差、负结果和实验条件版本化,再选择下一轮。

AI for Science 从问题与证据合同,经候选生成和代理模型筛选,分流到形式化校验、计算模拟或历史回测、现实实验与专家评价,再汇入版本化证据账本并反馈下一轮。
验证不是固定流水线:数学证明可止于形式化检查,天气依赖历史回测与真实观测,材料常先走 DFT 再进入合成;每一步只支持其评价合同覆盖范围内的主张。 查看原图 ↗
负结果也要存

若只回流成功样本,模型会不断强化“看起来像成功”的区域,却学不到哪些候选不可合成、数值不稳定或实验失败。科学 data lineage(数据血缘)应保存输入、代码、环境、仪器、原始观测和失败原因。

04 · 六个真实系统

读“AI 发现了……”之前,先看每个系统究竟输出什么

AlphaFold 3、GNoME、GenCast、AlphaGeometry、AlphaEvolve 与 Co-Scientist 的模型输出、论文 evaluator 和可声称证据范围对照,并区分预测、回测、形式化校验、实验支持与独立复现标签。
证据不是自动升级的楼梯:模型内置信度不是实验,论文回测不是未来部署,合作实验也不能自动写成不同团队的独立复现。 查看原图 ↗
STRUCTURE

AlphaFold 2 / 3

把结构搜索从实验前移,帮助解释和设计。pLDDT(predicted Local Distance Difference Test,预测局部距离差异测试)和 PAE(Predicted Aligned Error,预测对齐误差)提示模型内部置信,但高置信不能替代结构实验、功能实验和生物学上下文;2024 年 Nature Methods 的 102 个 PDB(Protein Data Bank,蛋白质结构数据库)条目样本也显示,高 pLDDT 区域仍可能有与实验数据不相容的局部结构。

SEARCH

GNoME

GNN(Graph Neural Network,图神经网络)+ DFT 的主动学习循环大幅扩展计算稳定晶体候选。论文的 736 个实验结构匹配是重要外部证据,却只覆盖 381,000 个新凸包条目的一小部分,也不是由 GNoME 前瞻性发起的 736 次合成。

ENSEMBLE

GenCast

条件扩散生成多条可能天气轨迹。概率预报的价值来自集合分布、校准和极端事件统计;论文还指出 1,320 个评分组合(scorecard target)存在变量相关性,不能把漂亮的汇总比例或某一条轨迹当作唯一未来。

PROOF

AlphaGeometry / 2

神经模块负责提出辅助构造,符号引擎负责演绎。可机检答案把“语言上像证明”和“逻辑上成立”分开;但语言只覆盖部分几何题型,形式化通过也不能外推到任意数学研究。

EVOLVE

AlphaEvolve

LLM 集成产生代码,自动 evaluator 运行并打分,程序数据库选择候选进入下一代。2025 白皮书报告了 4×4 复矩阵乘法只用 48 次标量乘法的程序;Google 2025/2026 内部基础设施收益仍按厂商披露处理。

HYPOTHESIS

Co-Scientist

多 Agent 反思、排名、进化研究假设,并调用搜索与专用模型。Nature 2026 论文的盲法专家比较只覆盖 15 个研究目标中的 11 个,且作者明确称主观偏好不是客观真值;三类生物医学案例均有 expert-in-the-loop(专家在回路)的合作实验,尚不等于跨团队独立复现。

05 · 科学 Agent

Agent 的价值是编排探索,不是把自信文字升级为证据

通用模型可以读文献、写代码、调用数据库和生成实验方案,但科学 Agent 只有在工具输入可追溯、evaluator 独立、资源有预算、失败能回滚时,才比一次性对话更可靠。

Generation:扩大候选覆盖

一次给出多组假设、分子、程序或实验条件,并记录来源与差异。目标不是第一稿正确,而是以低成本探索足够多、足够不同的方向。

Critique / Ranking:让候选互相竞争

反思 Agent 检查逻辑与证据,排名 Agent 组织 pairwise tournament(成对比较锦标赛)。自评只能作为搜索启发式;若评价器和生成器共享同一盲点,排名会把错误一起放大。

Tool execution:把句子变成可运行制品

代码要编译和跑测试,结构要进模拟器,文献结论要追到原文,实验方案要通过安全和可行性审查。所有工具结果仍是不可信输入,不能自动成为下一步高风险动作。

Human-in-the-loop(人在回路):把责任放回领域专家

专家确定问题是否值得问、约束是否合理、实验是否安全、指标是否真的代表科学价值。Agent 可以节省搜索与整理时间,但不能替代伦理、实验设计和最终责任。

2026 案例 · ERA

Empirical Research Assistance(ERA,经验研究辅助系统)用 LLM + Tree Search(树搜索)优化可计算质量指标。Nature 2026 论文报告:在 OpenProblems v2.0.0 单细胞批次整合基准的留出数据上,ERA 探索的 87 种最终策略中有 40 种超过当时榜单上的全部已发布方法;在使用截至 2025-05-01 数据开展的 COVID-19 住院预测回顾性研究中,有 14 种策略在论文用于横向比较的 3 周评测窗口(3 个参考日期 × 4 个预测时效 × 52 个辖区,以 WIS(Weighted Interval Score,加权区间得分)计)超过官方 CovidHub ensemble 和参评单模型。它说明“可执行软件 + 明确指标”适合 Agent 搜索,也同时暴露边界:榜单指标必须真实代表科学目标,外部数据、时间切分、前瞻性验证和后续复现仍不能省。

怎样判断问题适不适合科学 Agent

候选能否自动表示?得分能否可靠计算?失败成本能否承受?

矩阵乘法程序有明确输入输出和性能测试,非常适合进化 Agent;“提出一种新癌症治疗”没有单一廉价 evaluator,只能把 Agent 当假设助手,再进入长期的机制、毒理、动物、临床与监管验证。自动化程度应跟验证强度走,而不是跟模型文笔走。

06 · 证据与工程边界

一个科学模型至少要同时交代六张账

DATA

训练与时间切分

训练集是否包含测试结构、未来观测或近重复样本?科学数据相关性强,随机切分可能比真实“发现新区域”容易得多。

OOD

分布外能力

新蛋白家族、新化学空间、罕见天气和未见问题是否仍可靠?平均误差好看,可能掩盖最重要的长尾失败。

UNCERTAINTY

不确定性校准

先定义要校准的对象:分类事件概率、回归区间覆盖率、天气集合 spread–skill(集合离散度—误差关系),还是结构模型的局部置信。它们不能都解释成“80% 置信就有 80% 正确”;若分布外候选仍高置信,主动学习会把昂贵预算送错地方。

BASELINE

和谁比较

应与同预算、同数据截止时间的物理模拟、专家流程和简单启发式比较。即使近似模型数量级更快,若误差不足以支持筛选,或把昂贵验证预算集中到错误区域,仍没有科学价值。

LINEAGE

能否复现

固定数据快照、代码 commit、模型 revision、随机种子、硬件、模拟参数和实验批次。只有页面截图无法形成科学证据。

IMPACT

候选到真实影响

发现稳定晶体、合成材料、制成器件和形成产业影响是四个阶段;结构预测、靶点、药物与临床疗效同理。

读“AI 发现了 X”的五个追问

输出是什么?用什么 evaluator?数据何时截止?谁做了实验?是否独立复现?

把 headline 改写成一条可审计句子:系统在什么输入与切分上生成了什么制品;评价协议验证了哪一项性质;现实实验由论文作者、合作团队还是独立团队完成;当前证据只支持候选、回测、形式化通过、实验支持中的哪一层。只要这五项缺一项,就先不要把“模型成功”升级成“科学结论成立”。

RESEARCH LEDGER

一手来源与证据边界

优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。

R01
Highly accurate protein structure prediction with AlphaFoldJumper et al. · Nature · 2021

AlphaFold 2 的 Evoformer、结构模块、训练与 CASP14 结构预测结果。

R02
Accurate structure prediction of biomolecular interactions with AlphaFold 3Abramson et al. · Nature · 2024

AlphaFold 3 对蛋白、核酸、小分子等复合物的联合结构预测与 diffusion-based 结构生成。

R03
Scaling deep learning for materials discoveryMerchant et al. · Nature · 2023

GNoME 的图网络、主动学习、DFT 过滤和 381,000 个新凸包稳定结构结果。

R04
Probabilistic weather forecasting with machine learningPrice et al. · Nature 637 · 2025(在线发表于 2024-12-04)

GenCast 条件扩散、0.25° 全球网格、15 天概率集合预报,以及 1,320 个指标组合的回测口径。

R05
Learning skillful medium-range global weather forecastingLam et al. · Science · 2023

GraphCast 图神经网络、全球中期确定性天气预报和与数值模式的回测比较。

R06
Solving olympiad geometry without human demonstrationsTrinh et al. · Nature · 2024

AlphaGeometry 的神经语言模型与符号演绎引擎组合,以及可验证几何证明任务。

R07
Gold-medalist Performance in Solving Olympiad Geometry with AlphaGeometry2Chervonyi et al. · arXiv v3 · 初投 2025-02-05;修订 2025-12-08

AlphaGeometry2 的题目语言覆盖率、2000–2024 年 IMO 几何题求解率与评测范围;按预印本处理。

R08
AlphaEvolve: A coding agent for scientific and algorithmic discoveryNovikov et al. · white paper / arXiv · 2025-06-16

程序进化、evaluator 反馈、4×4 复矩阵乘法 48 次标量乘法案例,以及结果适用范围。

R09
AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithmsGoogle DeepMind · 2025-05-14

AlphaEvolve 的程序数据库、自动 evaluator 和 Google 内部部署案例;生产收益按发布方披露处理。

R10
AlphaEvolve: How our Gemini-powered coding agent is scaling impact across fieldsGoogle DeepMind · 2026-05-07

截至 2026 年的厂商披露应用;页面明确按发布者自报处理,不视为独立复现。

R11
Accelerating scientific discovery with Co-ScientistGottweis et al. · Nature 655 · 2026(在线发表于 2026-05-19)

多 Agent 架构、15 个研究目标中的 11 个盲法专家评估子集、三类生物医学合作验证与作者自述局限。

R12
An AI system to help scientists write expert-level empirical softwareAygün et al. · Nature 654 · 2026(在线发表于 2026-05-19)

ERA 的 LLM + tree search、40/87 单细胞方法结果,以及 COVID-19 住院预测的 3 周回顾性评测窗口。

R13
AlphaFold predictions are valuable hypotheses and accelerate but do not replace experimental structure determinationTerwilliger et al. · Nature Methods 21 · 2024

102 个 PDB 条目样本中的结构偏差分析,以及预测作为高价值假设、不能替代实验测定的边界。