状态传导图
terminated 表示任务终态;truncated 常表示时间或预算边界,二者的 value bootstrap 语义可能不同。
观察点 01
先固定起点、接口和结束语义
同一任务绑定环境、工具、策略和奖励版本,从可重置 snapshot 与 seed 开始。模型提出 action,Host Gate 校验后才改变环境;终止与超时截断分开记录。
- 环境可比性版本已绑定
- 外部副作用风险硬门隔离
没有可复位环境与版本,两个 rollout 的奖励可能根本不可比。
环境交互、轨迹证据、动作归属和独立评测缺一不可。终局奖励能区分结果,却不会自动指出哪个步骤造成成功。
状态传导图
terminated 表示任务终态;truncated 常表示时间或预算边界,二者的 value bootstrap 语义可能不同。
观察点 01
同一任务绑定环境、工具、策略和奖励版本,从可重置 snapshot 与 seed 开始。模型提出 action,Host Gate 校验后才改变环境;终止与超时截断分开记录。
没有可复位环境与版本,两个 rollout 的奖励可能根本不可比。
状态传导图
Mask 为 0 表示没有直接动作损失,不表示该上下文对后续 hidden state 没有影响。
观察点 02
任务、工具结果与人工审批是 context;模型生成的计划、调用名和参数才可能进入 policy-loss mask。轨迹同时保存 old logprob 与 behavior-policy 版本。
环境文本会影响后续预测,但不应被伪装成模型动作目标。
状态传导图
同组奖励全部相同时,组内标准化没有区分信号;步骤奖励也会继承排序器与奖励模型的偏差。
观察点 03
终局 verifier 给轨迹结果;return 可按时间折扣,GAE 用 value baseline,GRPO 比较同任务的一组轨迹,过程或隐式奖励再尝试细化到步骤。
“这条轨迹更好”不等于“已经知道轨迹里哪一步关键”。
状态传导图
DPO 与筛选式 SFT 可以使用轨迹数据,但不属于这条在线 advantage 更新链。
观察点 04
PPO 或 GRPO learner 只在有效动作位置更新,并限制 ratio、漂移与 staleness。候选策略要在留出任务上同时通过终态、安全、可靠性和成本门。
训练 reward 是学习信号,不应兼任唯一发布裁判。
你现在应该能解释:训练 reward 是学习信号,不应兼任唯一发布裁判。
Agentic Reinforcement Learning(Agentic RL,智能体强化学习)让策略在多步环境中提出动作,由宿主执行工具并接收新观察,再依据整条轨迹的结果更新策略。难点不只在“奖励稀疏”,还在环境能否重置、哪些 token 真由模型控制、行为策略是否过期,以及高分是否真的代表安全完成。
“用了 PPO / GRPO”并不足以证明系统在做 Agentic RL。关键问题是:策略动作是否真的改变外部环境,并在后续轮次收到由该状态产生的新观察。单轮推理强化学习、在线环境 RL 与离线轨迹偏好可以共享数据或算法部件,但训练合同不同。
| 路线 | 数据怎样产生 | 最小判断标准 |
|---|---|---|
| 单轮 reasoning RL / RLVR | prompt → 一段模型回答 → 规则或 verifier 评分 | Reinforcement Learning with Verifiable Rewards(RLVR,可验证奖励强化学习)可以训练推理,但若回答期间没有外部状态转移,就不是本文重点的环境交互型 Agentic RL。 |
| 在线 Agentic RL | 观察 → 模型动作 → 环境转移 → 新观察,反复多轮 | 环境可执行、可重置并返回可记录结果;训练数据来自某个可追溯行为策略的 rollout(交互采样)。 |
| 离线轨迹偏好 / 模仿 | 从日志或采样池构造 chosen / rejected 轨迹,或筛选成功轨迹做监督微调 | Direct Preference Optimization(DPO,直接偏好优化)与 rejection sampling(拒绝采样)可改进 Agent,却不要求训练时在线与环境交互,因此不能和在线 RL 画成同一条 advantage 更新链。 |
Agent 常被建模为 Partially Observable Markov Decision Process(POMDP,部分可观测马尔可夫决策过程):环境有真实状态,策略通常只看到 observation(观察)。因此“模型说任务完成了”不是终态;宿主必须从环境、测试或外部收据独立验收。
| 合同 | 最少保存什么 | 否则会错在哪里 |
|---|---|---|
| Environment contract 环境合同 | task_id、环境 / 工具版本、reset / snapshot、seed、观察与动作 schema、预算 | 不同 rollout 可能从不同状态开始;工具升级后,奖励与动作含义悄悄改变。 |
| Trajectory contract 轨迹合同 | episode_id、每轮 observation / action / tool receipt、时间与成本、terminated、truncated | 无法判断任务真的结束,还是仅因超时、token 或工具预算耗尽。 |
| Learning contract 学习合同 | policy / reward / verifier 版本、动作 mask、旧 log-probability、优势粒度、有效样本标记 | 把环境文本当模型动作训练,或拿过期概率计算错误的 policy ratio。 |
| Evaluation contract 评测合同 | 留出任务与环境、重复 trial、终态断言、安全 / 成本指标、晋升阈值 | 训练 verifier 的漏洞被当作能力,或一次幸运成功被当作稳定提升。 |
observation, reset_info = env.reset(seed=seed, snapshot=snapshot_id)
while budget.remaining:
proposal, action_logprobs = behavior_policy.act(observation)
action = host_gate.validate_and_authorize(proposal)
next_observation, reward, terminated, truncated, info = env.step(action)
trajectory.append(
observation, action, tool_receipt=info.receipt,
train_mask=model_controlled_positions(proposal),
old_logprob=action_logprobs,
env_version, policy_version, reward_version,
terminated, truncated, cost=info.cost
)
observation = next_observation
if terminated or truncated: break 这是合同示意,不是某个框架的 Application Programming Interface(API,应用程序编程接口)。Gymnasium 区分 terminated 与 truncated:前者表示到达任务定义的终止状态;后者通常来自时间或预算等外部边界。计算 value target 时,两者的 bootstrap 语义可能不同,不能只存一个 done。
在 token 策略中,系统提示、用户任务与工具结果会参与前向计算,影响后续 hidden state;但 policy loss(策略损失)的直接目标通常只覆盖模型控制的动作位置。若策略输出的是离散非文本动作,同一原则对应于那组动作分布。
| 轨迹片段 | 是否通常进入 policy-loss mask | 原因 |
|---|---|---|
| 系统 / 用户任务 | 否,作为 context | 由数据或宿主提供,不是策略在这一轮选择的动作。 |
| 模型计划或可见 reasoning | 取决于训练接口 | 若确由策略采样并被定义为动作,可训练;不要假设所有系统都暴露或保存内部推理。 |
| 工具名与参数 token | 通常是 | 它们是模型提出的动作;真实授权与执行仍由 Host Gate(宿主权限门)决定。 |
| 原始 tool result / 环境观察 | 否,作为 context | 来自环境。把它当作模型目标会让概率比、信用和审计归属全部错位。 |
| 宿主纠错、人工审批 | 默认否 | 是外部控制信号;若转换为监督数据,应显式进入另一份训练配方与数据版本。 |
old_logprob 要与实际采样动作、mask 和 policy_version 同步保存。异步 learner 更新后,旧 worker 仍可能产出数据;没有版本和 staleness(陈旧度)边界,就无法知道 ratio 比较的是哪两个策略。Credit assignment(信用分配)研究结果信号怎样影响更早的动作。长轨迹里常见四类近似:整轨迹 return、value / GAE、组内相对优势、过程或隐式步骤奖励。它们都能产生训练权重,但没有一种仅凭终局分数就恢复真实因果贡献。
把后续奖励按时间累计到先前动作。若只在第 4 步给终局奖励 1,且 γ = 0.9,四步 return 是 [0.729, 0.81, 0.9, 1]。这表达“越远权重越小”的时间偏好,不证明第 4 步比第 1 步更有因果贡献。
Generalized Advantage Estimation(GAE,广义优势估计)用 learned value 与 bootstrap 在偏差—方差之间取舍。critic 可降低方差,却会引入价值函数误差;被截断轨迹的 bootstrap 还依赖正确终止语义。
Group Relative Policy Optimization(GRPO,组相对策略优化)按同一任务的一组 rollout 比较奖励,省去独立 critic。它提供“哪条轨迹相对更好”的信号;若把同一轨迹优势复制到所有动作位置,仍没有找出哪一步导致成败。
Process Reward Model(PRM,过程奖励模型)可直接评分步骤;iStar 则从在线轨迹偏好训练隐式 PRM。信号更细,不等于没有偏差:排序质量、模型假设与分布变化会进入 credit。
[1, 0, 0, 1]。组均值为 0.5,population standard deviation(总体标准差)为 0.5,于是标准化优势为 [+1, -1, -1, +1]。它能提高两条成功轨迹中被 mask 的动作概率、压低失败轨迹,却不能告诉你“搜索、编辑、测试”哪一步关键。若四条奖励全相同,组标准差为 0;实现通常用 epsilon、跳过或 mask 处理,但组内本身不再提供区分信号。选算法前先问三件事:数据来自当前策略还是离线池?baseline(基线)来自 value、组均值还是参考策略?更新怎样限制策略漂移?名称相似不代表训练信号可互换。
| 路线 | 数据与目标 | Agentic 场景的边界 |
|---|---|---|
| PPO | Proximal Policy Optimization(近端策略优化)用行为策略采样,以 clipped surrogate 限制新旧策略 likelihood ratio;常配 value / GAE | critic 与长轨迹 value 估计增加复杂度。PPO 原算法不要求“相对某个 SFT reference 的 Kullback–Leibler divergence(KL divergence,KL 散度)”;Reinforcement Learning from Human Feedback(RLHF,人类反馈强化学习)或 Agent RL 实现可以另加 KL 或其他约束。 |
| GRPO | 同一任务采样一组轨迹,用组内奖励统计量构造相对优势,不训练独立 critic | 省去 critic 不等于总成本必然更低:每个任务要多次 rollout;奖励无差异或组不可比时,信号会退化。 |
| DPO / trajectory preference | 从 chosen / rejected 序列直接优化偏好目标,以 reference policy 约束相对变化 | 训练时不必在线执行环境;把整条轨迹当序列也不会自动产生步骤级因果 credit。iStar 用 multi-turn DPO 训练隐式步骤奖励,是一项具体设计。 |
| Rejection sampling + SFT | 采样多条,按 verifier 过滤或排序,把保留轨迹当监督数据最大化似然 | 不是 policy-gradient RL;流程简单但会丢失部分失败信息,verifier 漏洞也会被数据筛选放大。 |
模型生成、工具等待与长尾 episode 会让 Graphics Processing Unit(GPU,图形处理器)和环境彼此空等。生产级系统要解耦采样、存储、评分与学习,但每次解耦都必须保住数据完整性和 on-policy 边界。快,不等于可以混用版本。
| 组件 | 职责 | 关键验收 |
|---|---|---|
| Rollout workers | 绑定 behavior policy、环境快照、seed 与预算,执行多轮任务 | 每轮可追溯;沙箱可复位;超时和截断显式记录。 |
| Trajectory store | 保存动作、观察、收据、mask、old logprob、成本与全部版本 | 缺字段 / 重复 episode / 跨版本拼接应被拒收,而不是静默补齐。 |
| Verifier stack | 检查环境终态、过程约束、格式、安全与成本 | 奖励版本化;训练 verifier 与独立验收器分开;保留原始证据。 |
| Credit + learner | 构造 return / advantage,执行 PPO、GRPO 或其他策略目标 | 只更新有效动作位置;限制 staleness、ratio、梯度与策略漂移。 |
| Holdout evaluator | 在留出任务、环境版本与对抗案例上跑候选策略 | 未过任务、安全、成本和回归门,不得晋升到下一轮或生产。 |
以下数字均限定在论文版本、模型、脚手架与 benchmark;截至 2026-07-14,不把发布方自评、预印本或单一任务集外推为生产能力。
| 案例 | 论文内证据 | 应该怎样读 |
|---|---|---|
| WebAgent-R1 Conference on Empirical Methods in Natural Language Processing(EMNLP)2025 | 用在线网页交互、多样异步轨迹与 binary task-success reward 做端到端多轮 RL;WebArena-Lite 中 Qwen-2.5-3B 从 6.1% 到 33.9%,Llama-3.1-8B 从 8.5% 到 44.8% | 这是同论文设置下的显著增益,支持环境交互 RL 的可行性;不等于开放网页上的通用成功率。 |
| Agent-RLVR 2025 preprint | 用 guidance 与 environment rewards 处理软件工程 Agent 的稀疏奖励;Qwen2.5-72B-Instruct 在 SWE-bench Verified 的 pass@1 从 9.4% 到 22.4%,再配 test-time reward model 报告 27.8% | 指导信息改变训练分布,test-time reward model 也改变推理预算;三个数字不能当成“只换 RL 算法”的纯消融。 |
| iStar International Conference on Learning Representations(ICLR)2026 | 从在线正负轨迹对用 multi-turn DPO 训练 implicit PRM,再根据相对旧 policy snapshot 的变化产生步骤奖励;论文评测 WebShop、VisualSokoban 与 SOTOPIA | 说明步骤 credit 可以从轨迹偏好间接学习;它仍依赖排序、旧策略快照和实验环境,不是通用标准件。 |
| RAGEN 2025 preprint | 在多轮环境中研究 State-Thinking-Action-Reward Policy Optimization(StarPO,按正文首次定义),并报告 Echo Trap:奖励方差快速塌缩、梯度 spike,以及在缺少细粒度 reasoning-aware reward 时出现浅层策略 | 这是论文在其风格化环境中的训练现象,适合提醒监测奖励多样性与初始状态覆盖,不应写成所有 Agent RL 的定律。 |
| Kimi K2 报告 v2 · 2026 | 报告描述 agentic data synthesis 与 general / joint RL;历史 non-thinking 设置下报告 Tau2-Bench 66.1、ACEBench(En) 76.5、SWE-bench Verified 65.8 | 工具合成流水线中的 3,000+ 真实 Model Context Protocol(MCP,模型上下文协议)规格与 20,000+ 合成工具主要用于 SFT 数据构造,不能说成“20,000 个工具都参与 RL rollout”;分数也绑定该版本与 scaffold。 |
| DeepSeek-R1 边界案例 | R1-Zero 展示不先用 SFT cold start 的 reasoning RL;正式 R1 加入 cold-start、RL、rejection sampling 与 SFT 等多阶段 | 它证明可验证单轮推理 RL 的能力,不是外部工具环境多轮 Agent RL 的直接证据。“纯 RL”只适用于 R1-Zero 的特定起始路线,不适用于正式 R1 全流程。 |
训练 reward 是学习信号,不应兼任唯一裁判。评测器至少要与训练 verifier 有独立实现或独立数据,并读取最终环境状态、工具收据与安全日志;只让另一个模型评价“轨迹看起来不错”不够。
| 成绩单 | 建议指标 | 失败时说明什么 |
|---|---|---|
| Outcome | 独立终态断言、pass@1、任务完成率、部分完成分层 | 策略没有真正改变到目标状态,或 verifier 奖励了表面证据。 |
| Generalization | 留出任务、未见初始状态、工具 / 环境版本变化 | 记住了任务模板、测试漏洞或训练环境特征。 |
| Reliability | 多 seed / 多 trial 均值与区间、连续成功、截断率、恢复率 | 单次成功掩盖高方差、长尾失败或预算敏感。 |
| Safety | 越权请求率、硬门拦截率、重复副作用、注入与奖励黑客测试 | 任务分数通过牺牲权限、数据完整性或业务约束获得。 |
| Efficiency | token、rollout 数、工具次数、GPU / 环境时长、端到端成本 | 质量提升可能只是花了更多采样与 test-time compute,而非策略效率提升。 |
冻结任务与环境版本;建立可重置 snapshot;按模板、仓库、网站或用户实体做防泄漏切分;先验证 verifier 与真实终态一致。
监控 reward 分布、全同奖励组、截断、policy staleness、invalid action、重复 episode、工具错误、成本和梯度 spike。
用留出环境重跑;人工审计高分与失败轨迹;过安全、能力回归和成本门;保留旧策略与一键回滚路径。
| 主题 | 一手来源 | 本文使用范围 |
|---|---|---|
| 环境终止语义 | Gymnasium Basic Usage;Handling Time Limits | reset / step 与 terminated / truncated 区别。 |
| PPO / GAE | Proximal Policy Optimization Algorithms;Generalized Advantage Estimation | clipped objective、value baseline 与偏差—方差边界。 |
| GRPO / DPO | DeepSeekMath(GRPO);Direct Preference Optimization | 组内相对优势与离线偏好目标的机制差异。 |
| Web Agent RL | WebAgent-R1 · EMNLP 2025;WebRL | 在线网页 rollout、二元任务奖励与自演化 curriculum 案例。 |
| 代码 Agent RL | Agent-RLVR | guidance、环境奖励与 SWE-bench Verified 论文设置。 |
| 步骤 credit | iStar · ICLR 2026;RAGEN | 隐式步骤奖励与多轮 RL 训练动态;RAGEN 为预印本。 |
| 训练系统 | Agent Lightning;Microsoft Research 说明;DORA | 执行—训练解耦、动作 mask 与异步 rollout;DORA 数字为预印本自报。 |
| 模型案例 | Kimi K2;DeepSeek-R1 | 历史 agentic benchmark、数据 / RL 阶段与 reasoning-RL 边界。 |
核查日期:2026-07-14。论文指标只用于还原对应实验,不作为当前产品排名;预印本与发布方自评均已在正文显式标注。