AI 可以把海量候选缩成少量待验证候选,但最后一公里叫验证
科学模型最强的地方,不是替人宣布结论,而是学习昂贵规律、生成候选、排序实验和寻找可执行算法。只有当输出进入可证伪的模拟、证明、实验与独立复现闭环,‘模型觉得可能’才逐步变成可用知识。
把昂贵世界学成一个便宜近似,再让真实世界挑错
许多科学问题的搜索空间巨大:氨基酸如何折叠、原子怎样排列、未来大气会走哪条轨迹、哪个算法满足约束。直接为每个候选做实验、DFT、数值积分或形式证明太贵,模型就先充当 surrogate model(代理模型)——一个快很多、但可能出错的近似。
从输入预测性质
给定蛋白序列预测结构,给定晶体图预测形成能,给定当前天气预测未来场。输入已知,模型近似昂贵计算或测量。
反过来造候选
给目标性质生成分子、材料、轨迹或算法。生成器能探索人没写过的组合,也会产生化学不可合成、物理不稳定或程序错误的样本。
主动选择下一次实验
当不确定性已经按目标事件校准时,系统可把它与价值函数结合,决定“下一笔昂贵预算花在哪”。验证结果回流训练,形成 active learning(主动学习)数据飞轮;未校准的高置信不能直接支配实验预算。
模型像海选评委,DFT 像复试,真实合成才是决赛
先让生成或枚举系统提出数百万晶体结构,图网络快速估计稳定性,只把高分或高不确定候选送给昂贵的密度泛函理论计算;计算稳定还不等于能合成,最后要在实验室制备并测量性能。每一层都减少候选,也都可能误杀好材料或放过坏材料。
模型架构跟着科学对象走,而不是所有问题都套语言模型
蛋白与分子:一维序列要变成三维相互作用
AlphaFold 2 同时维护 MSA(Multiple Sequence Alignment,多序列比对)与残基对表示,反复交换信息,再由结构模块输出三维坐标。AlphaFold 3 扩到蛋白、核酸、小分子、离子和修饰残基的复合物,并使用 diffusion-based(基于扩散)结构生成。它输出的是结构假设及模型置信信息,不是结合能、药效、安全性和临床成功的总答案;AF3 论文在 PoseBusters 基准上仍报告 4.4% 手性违规,并明确列出碰撞、幻觉与静态结构等限制。
材料:原子与邻近关系天然是一张周期图
GNoME 把元素做节点、邻近关系做边,用消息传递图网络预测晶体总能,再以 VASP(Vienna Ab initio Simulation Package,维也纳第一性原理模拟软件包)的 DFT(Density Functional Theory,密度泛函理论)计算筛选稳定性。论文报告 220 万个相对 Materials Project 稳定的结构,其中 381,000 个新条目位于更新后的凸包;736 个结构与独立实验报告匹配,但这不等于 381,000 次前瞻性合成。动态稳定、可合成性和器件性能仍是后续问题。
天气:不是猜一张图,而是演化全球概率场
GraphCast 学确定性状态演化;GenCast 用条件扩散,从当前与上一时刻状态采样下一时刻,再自回归得到 0.25° 网格、12 小时间隔的 15 天集合轨迹。论文在 2019 年回测中称其 CRPS(Continuous Ranked Probability Score,连续排名概率得分)在 1,320 个变量、时效和高度层组合中的 97.2% 显著优于欧洲中期天气预报中心集合预报(ECMWF ENS);这些组合相互相关,不是 1,320 个独立任务。未来部署仍要持续检验校准、极端事件与观测漂移。
数学与算法:最宝贵的是自动检查器
AlphaGeometry 把神经生成与符号演绎组合,在 30 道奥赛级几何题中解出 25 道;2025 年 AlphaGeometry2 预印本把 2000–2024 年 IMO(International Mathematical Olympiad,国际数学奥林匹克)几何题的语言覆盖率从 66% 提到 88%,并在这 25 年的全部 IMO 几何题上报告 84% 求解率。这里的强证据来自可逐步检查的形式证明,但结论受题目语言与测试集范围约束。AlphaEvolve 同理:LLM(Large Language Model,大语言模型)写程序,编译、测试、目标函数或证明负责判真判优。
真正可扩展的系统,把失败也变成下一轮数据
只训练一次、输出一批结果,是静态预测服务;科学发现系统更像循环:先写清问题和证据合同,再生成候选、用代理模型筛选,并按任务选择形式化校验、历史回测、计算模拟或现实实验。不同 evaluator(评价器)可以串联,却不是所有任务都必须依次走“计算 → 实验”;最终要把误差、负结果和实验条件版本化,再选择下一轮。
若只回流成功样本,模型会不断强化“看起来像成功”的区域,却学不到哪些候选不可合成、数值不稳定或实验失败。科学 data lineage(数据血缘)应保存输入、代码、环境、仪器、原始观测和失败原因。
读“AI 发现了……”之前,先看每个系统究竟输出什么
AlphaFold 2 / 3
把结构搜索从实验前移,帮助解释和设计。pLDDT(predicted Local Distance Difference Test,预测局部距离差异测试)和 PAE(Predicted Aligned Error,预测对齐误差)提示模型内部置信,但高置信不能替代结构实验、功能实验和生物学上下文;2024 年 Nature Methods 的 102 个 PDB(Protein Data Bank,蛋白质结构数据库)条目样本也显示,高 pLDDT 区域仍可能有与实验数据不相容的局部结构。
GNoME
GNN(Graph Neural Network,图神经网络)+ DFT 的主动学习循环大幅扩展计算稳定晶体候选。论文的 736 个实验结构匹配是重要外部证据,却只覆盖 381,000 个新凸包条目的一小部分,也不是由 GNoME 前瞻性发起的 736 次合成。
GenCast
条件扩散生成多条可能天气轨迹。概率预报的价值来自集合分布、校准和极端事件统计;论文还指出 1,320 个评分组合(scorecard target)存在变量相关性,不能把漂亮的汇总比例或某一条轨迹当作唯一未来。
AlphaGeometry / 2
神经模块负责提出辅助构造,符号引擎负责演绎。可机检答案把“语言上像证明”和“逻辑上成立”分开;但语言只覆盖部分几何题型,形式化通过也不能外推到任意数学研究。
AlphaEvolve
LLM 集成产生代码,自动 evaluator 运行并打分,程序数据库选择候选进入下一代。2025 白皮书报告了 4×4 复矩阵乘法只用 48 次标量乘法的程序;Google 2025/2026 内部基础设施收益仍按厂商披露处理。
Co-Scientist
多 Agent 反思、排名、进化研究假设,并调用搜索与专用模型。Nature 2026 论文的盲法专家比较只覆盖 15 个研究目标中的 11 个,且作者明确称主观偏好不是客观真值;三类生物医学案例均有 expert-in-the-loop(专家在回路)的合作实验,尚不等于跨团队独立复现。
Agent 的价值是编排探索,不是把自信文字升级为证据
通用模型可以读文献、写代码、调用数据库和生成实验方案,但科学 Agent 只有在工具输入可追溯、evaluator 独立、资源有预算、失败能回滚时,才比一次性对话更可靠。
Generation:扩大候选覆盖
一次给出多组假设、分子、程序或实验条件,并记录来源与差异。目标不是第一稿正确,而是以低成本探索足够多、足够不同的方向。
Critique / Ranking:让候选互相竞争
反思 Agent 检查逻辑与证据,排名 Agent 组织 pairwise tournament(成对比较锦标赛)。自评只能作为搜索启发式;若评价器和生成器共享同一盲点,排名会把错误一起放大。
Tool execution:把句子变成可运行制品
代码要编译和跑测试,结构要进模拟器,文献结论要追到原文,实验方案要通过安全和可行性审查。所有工具结果仍是不可信输入,不能自动成为下一步高风险动作。
Human-in-the-loop(人在回路):把责任放回领域专家
专家确定问题是否值得问、约束是否合理、实验是否安全、指标是否真的代表科学价值。Agent 可以节省搜索与整理时间,但不能替代伦理、实验设计和最终责任。
Empirical Research Assistance(ERA,经验研究辅助系统)用 LLM + Tree Search(树搜索)优化可计算质量指标。Nature 2026 论文报告:在 OpenProblems v2.0.0 单细胞批次整合基准的留出数据上,ERA 探索的 87 种最终策略中有 40 种超过当时榜单上的全部已发布方法;在使用截至 2025-05-01 数据开展的 COVID-19 住院预测回顾性研究中,有 14 种策略在论文用于横向比较的 3 周评测窗口(3 个参考日期 × 4 个预测时效 × 52 个辖区,以 WIS(Weighted Interval Score,加权区间得分)计)超过官方 CovidHub ensemble 和参评单模型。它说明“可执行软件 + 明确指标”适合 Agent 搜索,也同时暴露边界:榜单指标必须真实代表科学目标,外部数据、时间切分、前瞻性验证和后续复现仍不能省。
候选能否自动表示?得分能否可靠计算?失败成本能否承受?
矩阵乘法程序有明确输入输出和性能测试,非常适合进化 Agent;“提出一种新癌症治疗”没有单一廉价 evaluator,只能把 Agent 当假设助手,再进入长期的机制、毒理、动物、临床与监管验证。自动化程度应跟验证强度走,而不是跟模型文笔走。
一个科学模型至少要同时交代六张账
训练与时间切分
训练集是否包含测试结构、未来观测或近重复样本?科学数据相关性强,随机切分可能比真实“发现新区域”容易得多。
分布外能力
新蛋白家族、新化学空间、罕见天气和未见问题是否仍可靠?平均误差好看,可能掩盖最重要的长尾失败。
不确定性校准
先定义要校准的对象:分类事件概率、回归区间覆盖率、天气集合 spread–skill(集合离散度—误差关系),还是结构模型的局部置信。它们不能都解释成“80% 置信就有 80% 正确”;若分布外候选仍高置信,主动学习会把昂贵预算送错地方。
和谁比较
应与同预算、同数据截止时间的物理模拟、专家流程和简单启发式比较。即使近似模型数量级更快,若误差不足以支持筛选,或把昂贵验证预算集中到错误区域,仍没有科学价值。
能否复现
固定数据快照、代码 commit、模型 revision、随机种子、硬件、模拟参数和实验批次。只有页面截图无法形成科学证据。
候选到真实影响
发现稳定晶体、合成材料、制成器件和形成产业影响是四个阶段;结构预测、靶点、药物与临床疗效同理。
输出是什么?用什么 evaluator?数据何时截止?谁做了实验?是否独立复现?
把 headline 改写成一条可审计句子:系统在什么输入与切分上生成了什么制品;评价协议验证了哪一项性质;现实实验由论文作者、合作团队还是独立团队完成;当前证据只支持候选、回测、形式化通过、实验支持中的哪一层。只要这五项缺一项,就先不要把“模型成功”升级成“科学结论成立”。
一手来源与证据边界
优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。
AlphaFold 2 的 Evoformer、结构模块、训练与 CASP14 结构预测结果。
AlphaFold 3 对蛋白、核酸、小分子等复合物的联合结构预测与 diffusion-based 结构生成。
GNoME 的图网络、主动学习、DFT 过滤和 381,000 个新凸包稳定结构结果。
GenCast 条件扩散、0.25° 全球网格、15 天概率集合预报,以及 1,320 个指标组合的回测口径。
GraphCast 图神经网络、全球中期确定性天气预报和与数值模式的回测比较。
AlphaGeometry 的神经语言模型与符号演绎引擎组合,以及可验证几何证明任务。
AlphaGeometry2 的题目语言覆盖率、2000–2024 年 IMO 几何题求解率与评测范围;按预印本处理。
程序进化、evaluator 反馈、4×4 复矩阵乘法 48 次标量乘法案例,以及结果适用范围。
AlphaEvolve 的程序数据库、自动 evaluator 和 Google 内部部署案例;生产收益按发布方披露处理。
截至 2026 年的厂商披露应用;页面明确按发布者自报处理,不视为独立复现。
多 Agent 架构、15 个研究目标中的 11 个盲法专家评估子集、三类生物医学合作验证与作者自述局限。
ERA 的 LLM + tree search、40/87 单细胞方法结果,以及 COVID-19 住院预测的 3 周回顾性评测窗口。
102 个 PDB 条目样本中的结构偏差分析,以及预测作为高价值假设、不能替代实验测定的边界。