跳到正文
TRUST & MEASUREMENT · LLM EVALUATION

评测不是一张总榜,而是一份可复算的发布证据

一个平均分无法说明谁会受益、哪类失败被掩盖、差值是否可信,也无法决定能不能上线。可信评测从用户任务和风险合同出发,保存逐样本证据,用适合数据结构的统计方法表达不确定性,再把结论翻译成 Shadow、Canary、停止与回滚动作。

文本、文档、工具轨迹和视频帧从左侧进入透明测量装置,合格证据流向绿色发布门,不确定与失败证据进入人工复核账本
总览:评测把不同系统的输出变成“通过、分歧、失败”三类可追溯证据;只有通过统计门和风险门的候选才进入发布,争议与失败回到复核和回归集。图表达直觉,后文 SVG 给出精确合同。
01 · DEFINE THE MEASUREMENT CONTRACT

先定义“对谁、完成什么、错了多贵”,再选题库和指标

“模型 A 比模型 B 高 2 分”至少漏了五件事:进入分母的请求、人类真正完成的任务单位、成功与风险定义、系统版本,以及差值要触发的动作。公开榜单适合建立参照,不等于生产验收。HELM 把评测写成场景、适配方法和多指标的组合;NIST 的生成式 AI 风险档案则把测试、红队和部署后监测放进同一生命周期。E01E06

POPULATION

谁进入分母

语言、地区、租户、权限、产品入口、时间窗与 fallback 路由共同定义 eligible population。样本来自哪个分布必须可说清。

UNIT

什么是一项任务

一道题、一次会话、一张工单、一次退款终态会产生完全不同的样本量和相关结构;最小日志行不一定是统计单位。

SUCCESS

怎样算完成

写出可接受行为集合、必须证据、允许拒答、业务终态和禁止副作用,不让“语言很像成功”代替真实成功。

LOSS & BUDGET

失败和资源有多贵

把安全、权限、资金、错误建议、Token、步骤、P95 延迟与人工升级纳入合同;关键风险不应被平均质量抵消。

DECISION

结果会触发什么

预先写明实际提升阈值、可容忍退化、关键分桶红线、Shadow / Canary 入口和 rollback 条件,避免看完结果再改标准。

评测合同从适用人群、任务单位、成功风险、预算、版本切分开始,形成冻结评测包;新旧系统在相同 sample ID 上保存逐样本证据,再经配对统计、实际意义和风险硬门得到发布动作
一条可审计结论必须能从发布动作反查到统计区间、逐样本差值、评分器版本、系统 Manifest 与样本合同。高风险红线单独判断,不被总体均值冲淡。 查看原图 ↗
真实研究 · 排名会对实现细节敏感

同一批热门选择题,只改变选项顺序或答案选择方法,论文实验中的模型排名最多变化 8 位

这不说明所有榜单都无效,而是说明 Prompt、chat template、few-shot、解码、答案抽取和代码 commit 都是测量仪器的一部分。lm-evaluation-harness 的任务 YAML、seed、逐样本日志和保存的 chat template 提供了一套工程范式。E05E02E03

污染不是二元标签

公开问题可能进入预训练、微调、合成数据或人工提示优化。时间切分、私有集、近重复检查和持续更新能降低已知泄漏,却不能证明“绝对无污染”。LiveBench 用近期来源、客观答案和持续更新减轻风险;页面采用更审慎的 contamination-limited(污染受限)表述。E04

02 · DATA, SLICES & GRADERS

先保证样本可解释,再让足够低歧义的评分器判定

评测数据不是一袋问题。每条样本需要来源、eligibility、任务 ID、切片、标注依据和生命周期;每个分数需要评分器类型、版本、原始判词与解析状态。没有这些字段,失败只能“看起来像模型问题”。

DATA LINEAGE

来源与授权

记录数据 owner、采集用途、版权 / 许可、敏感等级、保留期和删除规则。生产失败进入回归集前先去标识、去重并做授权检查。

SPLIT

切分与外推

同时保留固定回归集和时间 / 来源 / 租户外推集;避免同一模板、会话、文档近重复或同一业务实体跨 train / test。

SLICE

关键分桶

按语言、风险、难度、输入长度、工具、知识版本和用户群报告。总体 +2 可能同时包含低价值 +5 与高风险 −8。

ANNOTATION

标注不确定性

给边界样本允许“不可判 / 信息不足”;抽样双标,报告一致性与裁决率。共识标签也不是脱离指南和专家范围的宇宙真值。

评分证据从规则与 Schema、参考答案与执行式检查器、经过校准的 LLM Judge 到双人标注与专家裁决逐层增加语义判断;右侧用人类金标集、位置一致性、重复稳定性和分桶错误率对 Judge 做元评测
优先用能回答问题的低歧义层:格式约束交给规则,代码与状态交给执行器,开放语义才进入校准 Judge;高风险和分歧样本回到独立人审。人审也要指南、一致性与裁决记录。 查看原图 ↗
RULE

规则 / Schema

适合格式、枚举、必需字段、禁止动作;它可复现,但不懂语义等价。Parser 失败必须单列,不能悄悄算 0 或忽略。

EXECUTION

单测 / 状态检查器

代码放进隔离环境执行,Agent 读取数据库或桌面终态;oracle、fixture 和环境镜像也要版本化。Inspect 的沙箱工具说明了为什么执行本身是安全边界。E07E08

SEMANTIC

Rubric + Judge

适合相关性、完整性、语气与开放答案。Rubric 要拆维度、给正反例和参考证据;不要只问“这个答案好吗?”。

ADJUDICATION

人类 / 专家裁决

用于高风险、争议与校准集。独立盲审后再讨论,比一开始共同商量更容易测量真实分歧;保留 adjudication reason。

03 · JUDGE CALIBRATION & UNCERTAINTY

Judge 是测量仪器;区间是对抽样波动的说明,不是免审许可证

LLM-as-a-Judge 能把开放式比较扩到大规模,但它不是 oracle(神谕)。MT-Bench 论文已讨论位置、冗长、自增强偏置和推理局限;后续研究把位置一致性系统化,JudgeBench 又显示一些强 Judge 在困难、客观可判的答案对上只略高于随机。结论不是“不要用”,而是先做 meta-evaluation(元评测),再限定用途。E09E10E11

01 · RUBRIC

先写维度和证据

把“正确、完整、忠实、简洁、合规”拆开,给参考答案、允许变体、反例和“信息不足”出口。G-Eval 的结构化标准是实例,不是跨任务通用精度保证。E13

02 · BLIND & SWAP

隐藏身份,交换位置

随机 A/B 顺序,关键比较双跑原序与交换序;若两次决定冲突,标记为 position-discordant 并进入复核,而不是静默取平均。

03 · META-EVAL

在人类 Gold Set 上校准

报告总体与分桶 agreement、解析失败、重复稳定性、swap consistency、拒判率和成本。不要只挑一个总体相关系数。

04 · VERSION

冻结 Judge 全栈

记录模型与返回版本、system / rubric / reference、temperature、最大长度、解析器和重试。Judge 升级相当于换尺,历史分数不可直接拼接。

“自偏好”要谨慎说

一些实验发现 Judge 更偏好熟悉、低困惑度的表达,不等于它必然偏爱“同厂模型”的每个回答。隐藏模型身份、跨家族校准和人类 Gold Set 比一句“不要自产自评”更可操作。E12

新旧系统在相同 task_id 上形成配对结果;普通任务成对重采样 task_id,并在每次重采样中重算两系统聚合指标及差值;重复 Agent 试验按任务聚类或使用层级模型;差值区间再与实际提升阈值、非劣界和风险硬门比较
单系统成功比例可用 Wilson 区间;系统差值要保留同样本配对。若每个任务有多次随机运行,trial 嵌套在 task 内,不能把所有轨迹当成彼此独立的新任务。 查看原图 ↗
手算 · 单个成功比例

200 个独立任务成功 144 个:点估计 72.0%,Wilson 95% 区间约 65.4%~77.8%

它表示:若不断按同一抽样机制重复构造区间,长期约 95% 的区间会覆盖总体比例;不是“真实成功率有 95% 概率落在这次区间里”。普通 Wald 正态区间在小样本或比例接近 0 / 1 时覆盖更差,NIST 给出 Wilson 方法。这个区间只描述一个系统,不能拿 72% 与 73% 两个独立区间的重叠程度代替新旧系统的配对比较。E14

PAIRED DELTA

同一任务跑 baseline 与 candidate

task_id 成对重采样同一批新旧结果,并在每次 bootstrap 中重算两系统的聚合指标及差值。只有指标可分解为逐任务分数时,才可直接重采样逐任务差值;corpus BLEU 一类非可加指标不能先造“逐句 BLEU”。Koehn 2004 与 Dror 等 2018 给出经典方法与选择指南。E16E15

HIERARCHY

题目 × 重复 × 轨迹是嵌套数据

先声明外推对象与 task 权重。若 task 是抽样单位,可按 task 聚类重采样;若同时表达 task 与 trial 两层波动,使用 task→trial 两阶段 bootstrap,或预先指定任务权重的层级二项 / GLM / Bayesian 模型。十次同题运行不能等价成十个独立任务。HiBayES 提供一套具体框架。E17

PRACTICAL MARGIN

统计不确定性之外还要业务阈值

δ_ship 表示值得承担迁移成本的最小实际提升;δ_regress 表示可容忍退化。选择 superiority(优效)还是 non-inferiority(非劣)应在看结果前写明。

POWER

没有万能的“至少 200 条”

样本量取决于 baseline、目标 MDE(Minimum Detectable Effect,最小可检测效应)、方差、配对相关、分桶数量、重复结构和可接受误判。先做 power / precision 规划,再决定样本和周期。

04 · RAG EVIDENCE LEDGER

RAG 要把“找到、依据、引用、答对”拆成四本账

端到端成功率回答用户问题是否解决,组件指标回答为什么。检索命中不保证生成忠实,回答正确也可能只是参数记忆或猜中;引用看起来专业,也可能不支持对应 claim(主张)。RAGAS、RAGChecker 和 ALCE 分别提供了自动评测与细粒度引用诊断的研究实例,但自动分数仍要在目标语言、领域和错误类型上做人类元评测。E18E19E20

RAG 评测从问题和访问资格、语料快照进入检索 Top-k,再到实际拼接上下文、生成回答、claim 与引用证据以及最终用户任务;下方分别定义检索、依据、引用和答案分数,并用检索命中与生成成功的四象限定位失败
先冻结 corpus、eligibility、retrieval unit 和 relevant set;Hit@k / Recall@k 只在 |relevant|>0 的可回答题上计算。无答案题单列拒答、误召回与 abstention。Faithfulness 不等同于现实正确或答案完整。 查看原图 ↗
HIT@K · 可回答题𝟙[top-k ∩ relevant ≠ ∅]

只在 |relevant|>0 的题上问前 k 个单元是否至少命中一个;一个命中和十个命中都记 1。无答案题另测正确拒答与 false retrieval。

RECALL@K · 可回答题|top-k ∩ relevant| / |relevant|

分母是该题完整的 gold relevant set,且必须大于 0。若只标一个“答案文档”,它测的是那个标注合同,不是未知的全部相关证据。

CITATION CORRECTNESS · 本页口径受证据支持的已评引用 / 已评引用

先规定引用单位是 link、span 还是 claim-citation pair;冲突、打不开和只相关不支持要单列。已评引用为 0 时记 N/A,并另报 citation coverage 与 N/A 率。

CITATION COMPLETENESS · 本页口径有支持引用的应引 claim / 应引 claim

先标哪些 claim 需要证据。应引 claim 为 0 时记 N/A;有应引 claim 但没有支持引用时记 0。正确性高而完整性低,意味着“引的都对,但漏引很多”。

冻结 eligibility 与知识快照

权限、时效、生效版本和对象状态先决定候选资格。相关但无权的文档不是低排名,而是不应进入检索集合;权限泄漏是风险失败,不是 Recall 提升。

把检索单位写进分母

chunk、passage、document、parent document 的 relevant set 不可混用;Top-5 chunks 与 Top-5 documents 也不是一回事。保存 rank、score、object ID、chunk 边界与过滤原因。

按 claim 对齐回答和 Context

把回答拆成可验证主张,分别标 supported、contradicted、not-in-context,再单独判断现实正确性与任务完整性。Faithful 可以忠实复述一份过期或错误资料。

端到端分数仍要保留

检索与生成组件都高分,也可能因拼接截断、权限、版本冲突、拒答策略或延迟失败。最终任务成功、风险、成本与用户升级率决定产品是否可用。

05 · AGENT STATE, TRIALS & RELIABILITY

Agent 的“答案”是环境状态、操作收据和完整轨迹

静态问答通常一题一次输出;Agent 会观察、调用工具、修改外部世界并受重试、网页变化和服务故障影响。τ-bench 用会话结束后的数据库状态对照目标状态,OSWorld 发布了 369 项真实电脑任务和执行式脚本:共同点是不能让 Agent 自己宣布“已完成”。E21E22

Agent 任务先冻结初始环境、允许行为、故障策略和终态检查器;同一任务运行三次并保存观察动作工具收据,trial 异常进入环境故障桶;结果跨任务估计一次成功概率、至少一次成功概率 pass@k 与全部成功概率 pass^k
对单个 task 的这一次 n=k=3 连跑,✓✓✕ 的“至少一次”事件值为 1,“全部成功”事件值为 0;基准的 pass@3 / pass³ 还要用每题成功次数跨任务估计,不能把这一个事件值当总榜。 查看原图 ↗
RESET

每次从可比初态开始

冻结数据库 fixture、账号权限、时间、应用版本、工具 schema 和缓存。若真实网页无法完全冻结,记录差异并把环境版本作为随机效应或限制。

VERIFY

读取真实终态与副作用

同时检查目标状态、越权、重复操作、遗漏状态、收据和预算。文本回答只是轨迹的一部分;“我已退款”不能替代账本中的退款记录。

REPEAT

重复 trial,不丢 task_id

报告 trial 数和随机性来源,保存 task → trial → trajectory 层级。AgentBench 展示了跨交互环境的评测需求;生产任务还要覆盖自己的工具与政策。E23

FAULT

区分基础设施与模型行为

API 500、页面加载失败、测试台脏状态单列;但系统是否识别 timeout、查询既有收据、安全重试或退出,仍属于 Agent 能力。是否计入产品可用性由合同预先决定。

能力视角pass@k = 1 − E[C(n−c,k)/C(n,k)]

表示 k 次独立 trial 至少一次成功的概率,也常被称为 success@k。每题运行 n≥k 次、成功 c 次后按任务取平均;k 越大通常越乐观,也增加成本。

可靠性视角pass^k = E[C(c,k)/C(n,k)]

表示 k 次独立 trial 全部成功的概率,并在任务上取平均;C(a,b) 是组合数,约定 b>a 时为 0。τ-bench 用这个无偏估计强调连续可靠性。E21

产品视角success × safety × budget

成功但重复扣款、越权读数据或成本超线仍是失败;多目标结果不应被一个“Agent 分数”吞掉。

06 · MULTIMODAL & VIDEO

原始媒体不是模型输入;消融用来证明它真的使用了视觉、时序或音频

图像 resize / crop、视频帧数与时间戳、帧序、视觉 Token、字幕和音频开关都会改变任务。MMStar 用 1,500 个经人工筛选的视觉不可替代样本,专门诊断“不看图也能答”;Video-MME 包含 900 个视频、2,700 道问答,覆盖 11 秒到 1 小时,并比较音频和字幕条件。数字描述论文基准,不是生产采样的默认值。E26E25

多模态评测从原始媒体经过 resize、crop、帧采样、时间戳、帧序、音频与字幕配置,保存实际输入和逐样本证据;下方分别进行只给文字、打乱帧序、遮挡关键区域、去音频与去字幕的消融并读取差值
消融回答“模型依赖哪种信息”,不是自然流量最终分数。FULL 与 TEXT-ONLY 接近可能是题干捷径;打乱帧序明显下降才支持任务确实测到时序。 查看原图 ↗
VISUAL DEPENDENCY

先问“图是否不可替代”

完整输入与 text-only 对照;遮挡关键区域、替换无关图、打乱 image order。若文本模型也高分,可能是常识、模板或污染,不是视觉能力。

TEMPORAL

视频要保存时间结构

均匀抽帧可能看见所有物体却丢掉先后、持续时间和跨镜头因果。保存 frame index、timestamp、采样策略与实际帧;打乱顺序用于诊断时序依赖。

MODAL CONTRIBUTION

音频与字幕分开开关

full、video-only、video+audio、video+subtitle 形成受控比较;字幕本身可能直接泄漏答案,音频也可能只提供背景线索。

HOLISTIC SLICES

别让一个视觉总分藏住风险

MMMU 覆盖跨学科推理;VHELM 扩展到感知、偏见、公平、知识、多语言、推理、鲁棒、安全与毒性等 9 个方面。选与产品合同有关的 slice。E24E27

标准化不等于统一真相

LMMs-Eval 试图统一模型、数据集和推理配置,并明确覆盖、成本与污染之间的评测三难。框架让比较更一致,但不能替代产品自己的 preprocessor、输入权限、长视频分布和延迟预算。E28

07 · OFFLINE → SHADOW → CANARY → ONLINE

离线证明“值得试”,线上证明“对真实用户可用”

离线集能冻结条件、快速定位回退,却不能复现真实到达过程、工具故障、流量混合和用户适应。Shadow 仅在用途、接收方和保留期均获授权并完成数据最小化后复制请求;能去标识时先去标识。候选输出不返回用户,所有写工具和外部副作用必须禁用或指向隔离环境。Canary 再把真实影响限制在小流量;线上失败经人工确认后进入版本化回归集。每一阶段都要有入口门、停止条件和独立稳定基线。

候选系统依次经过离线冻结评测、只读隔离的 Shadow、Canary 小流量、分阶段放量和线上监测;离线不通过则 HOLD 和修复,真实流量阶段越过停止条件则缩流量或切回独立稳定基线;线上失败经隐私与选择记录、人工裁决进入版本化回归集,再返回下一候选的离线评测
影响半径随阶段扩大,失败动作也不同:离线 HOLD / FIX,线上阶段停止或缩流量并切回稳定基线。生产失败先记录 cohort、隐私处理和裁决,再进入下一候选的冻结评测。 查看原图 ↗
OFFLINE GATE

同一冻结包配对回放

总体与关键分桶同时看质量差值区间、风险覆盖、P95 / P99、成本和失败类型;执行式任务用隔离环境,不直接触发生产副作用。

SHADOW GATE

不返回输出,不等于无影响

检查真实 schema、路由、上下文长度、只读工具兼容、延迟和成本;候选 Provider 的准入、数据驻留与保留策略也要过门。记录 requested / returned model,避免 fallback 污染比较。

CANARY GATE

小流量且预置停止条件

若要把线上差异归因于候选,优先随机分配 eligible 用户并记录 exposure。风险定向的非随机 Canary 只作运行验证,要报告 cohort / 基线差异,不把未经调整的差异写成因果效果。越线立即停止。

ONLINE LOOP

监控分桶与长期结果

区分短期代理指标和业务终态;失败样本进入回归集时保存来源、selection reason、consent、owner、expiry 和 train / tune / test 去向。

至少冻结常见静默漂移
DATAdataset hash、sample IDs、eligibility、split、slice、标注指南语料更新、近重复、权限或时间窗改变
SYSTEMrequested / returned model、Prompt、template、decoding、retriever / toolsProvider alias、fallback、索引和工具 schema
GRADER规则 / 执行器 / Judge、rubric、reference、parser、校准集Judge 模型、位置顺序、解析重试
HARNESScode commit、环境镜像、seed、并发、超时、重试和日志 schema依赖升级、缓存、测试台状态与网络故障
DECISIONprimary / guardrail、δ、区间方法、关键 slice、停止与回滚看完结果后换指标、删分桶或移动阈值
08 · EVALUATION DESIGN LAB

把系统、判定和风险组合成一份最小评测骨架

这个工具不替你生成数据,也不猜一个万能样本量。它把选择翻译成必须落盘的合同、评分器、统计单位和发布门;右侧 Wilson 计算器只用于一个二项成功比例,不用于新旧版本差值。

MINIMUM EVIDENCE PLAN

文本模型 · 规则可判 · 实际提升 · 低风险

    RESEARCH LEDGER

    一手来源与证据边界

    优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。

    E01
    Holistic Evaluation of Language ModelsLiang et al. · TMLR 2023

    以场景、适配方法和多指标组织透明评测,而不是把模型压成单一准确率。

    E02
    Language Model Evaluation Harness · Task GuideEleutherAI · docs @ f4d4b3d · 2026-07-17

    YAML 任务配置、数据与提示字段、版本和可复现评测包的工程口径。

    E03
    Language Model Evaluation Harness · InterfaceEleutherAI · docs @ f4d4b3d · 2026-07-17

    记录 seed、chat template、逐样本日志、输出路径和完整运行配置。

    E04
    LiveBench: A Challenging, Contamination-Limited LLM BenchmarkWhite et al. · ICLR 2025 Spotlight

    初版标题曾使用“Contamination-Free”;当前修订版改为“Contamination-Limited”,以近期来源、持续更新问题和客观评分降低已知污染风险。

    E05
    When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model LeaderboardsAlzahrani et al. · ACL 2024

    选择题顺序、答案选择方式等细节会改变结果;论文实验中排名最多变化 8 位。

    E06
    Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence ProfileNIST AI 600-1 · 2024

    把预部署测试、风险测量、红队和部署后监测放进生成式 AI 生命周期。

    E07
    Open sourcing our testing framework InspectUK AI Safety Institute · 2024

    以 Task、Solver、Scorer 组织可复现评测,并支持模型能力与安全测试。

    E08
    The Inspect Sandboxing Toolkit: Scalable and secure AI agent evaluationsUK AI Safety Institute · 2025

    代码与 Agent 评测需要隔离、可控和可扩展的执行环境。

    E09
    Judging LLM-as-a-Judge with MT-Bench and Chatbot ArenaZheng et al. · NeurIPS 2023 Datasets & Benchmarks

    LLM Judge 的规模化价值,以及位置、冗长、自增强偏置和推理局限。

    E10
    Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-JudgeShi et al. · IJCNLP-AACL 2025

    用重复稳定性、位置一致性和偏好公平性系统测量 Judge 的位置偏差。

    E11
    JudgeBench: A Benchmark for Evaluating LLM-based JudgesTan et al. · ICLR 2025

    在有客观正确性的困难对比样本上做 Judge 元评测,展示强 Judge 也可能接近随机。

    E12
    Self-Preference Bias in LLM-as-a-JudgeWataoka et al. · 2024

    把所谓“自偏好”进一步拆到对熟悉、低困惑度表达的偏好,避免过度概括。

    E13
    G-Eval: NLG Evaluation using GPT-4 with Better Human AlignmentLiu et al. · EMNLP 2023

    以详细标准、推理步骤和结构化表单评估开放式生成;论文相关性只绑定其具体设置。

    E14
    Confidence intervals for a binomial proportionNIST/SEMATECH e-Handbook

    单个成功比例的 Wilson 置信区间及其覆盖率动机。

    E15
    The Hitchhiker’s Guide to Testing Statistical Significance in Natural Language ProcessingDror et al. · ACL 2018

    按问题结构选择配对检验、bootstrap 等方法,而不是只报告一个 p 值。

    E16
    Statistical Significance Tests for Machine Translation EvaluationKoehn · EMNLP 2004

    在同一测试样本上使用配对 bootstrap 比较系统差异的经典方法。

    E17
    HiBayES: A hierarchical bayesian modelling framework for AI evaluation statisticsUK AI Safety Institute · 2025

    处理题目、重复运行和复杂 Agent 评测的层级结构与低数据不确定性。

    E18
    RAGAs: Automated Evaluation of Retrieval Augmented GenerationEs et al. · EACL 2024 System Demonstrations

    把检索相关性、回答忠实度等维度分开;自动指标仍需在目标任务上校准。

    E19
    RAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented GenerationRu et al. · 2024

    用细粒度 claim 级指标定位 Retriever 与 Generator 的不同失败。

    E20
    Enabling Large Language Models to Generate Text with CitationsGao et al. · EMNLP 2023

    ALCE 同时评估流畅性、回答正确性与引用质量;引用质量以 citation precision / recall 衡量。

    E21
    τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World DomainsYao et al. · 2024

    用数据库终态判定交互 Agent,并以跨任务估计的 pass@k / pass^k 分别表达至少一次成功与全部成功的概率。

    E22
    OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer EnvironmentsXie et al. · 2024

    369 项跨应用电脑任务、初始状态配置与执行式评测脚本的公开案例。

    E23
    AgentBench: Evaluating LLMs as AgentsLiu et al. · ICLR 2024

    跨多种交互环境测量长期决策,而非只看静态单轮回答。

    E24
    MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGIYue et al. · CVPR 2024

    以跨学科图表、图像和专家知识任务评估视觉语言推理。

    E25
    Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video AnalysisFu et al. · CVPR 2025

    900 个视频、2,700 道问答、11 秒到 1 小时时长,并比较音频与字幕条件。

    E26
    Are We on the Right Way for Evaluating Large Vision-Language Models?Chen et al. · NeurIPS 2024

    MMStar 的 1,500 个视觉不可替代样本与视觉依赖、数据泄漏诊断。

    E27
    VHELM: A Holistic Evaluation of Vision Language ModelsLee et al. · NeurIPS 2024

    以 9 个方面、标准化推理参数和公开原始输出组织多维视觉语言评测。

    E28
    LMMs-Eval: Reality Check on the Evaluation of Large Multimodal ModelsZhang et al. · Findings of NAACL 2025

    标准化多模态模型、数据集和推理配置,并讨论覆盖、成本与污染的评测三难。