跳到正文
动手理解 · CONCEPT LAB

把一次 Agent 任务变成可归责的策略更新

环境交互、轨迹证据、动作归属和独立评测缺一不可。终局奖励能区分结果,却不会自动指出哪个步骤造成成功。

已经发生 正在观察 接下来
01 / 04

状态传导图

RESET snapshot / seed
OBS 环境观察
POLICY 策略提案
GATE 权限硬门
ENV 状态转移
END 终止 / 截断

terminated 表示任务终态;truncated 常表示时间或预算边界,二者的 value bootstrap 语义可能不同。

观察点 01

先固定起点、接口和结束语义

同一任务绑定环境、工具、策略和奖励版本,从可重置 snapshot 与 seed 开始。模型提出 action,Host Gate 校验后才改变环境;终止与超时截断分开记录。

环境可比性版本已绑定
外部副作用风险硬门隔离
此刻要记住

没有可复位环境与版本,两个 rollout 的奖励可能根本不可比。

Agent 训练 · Agentic Reinforcement Learning

奖励一条轨迹,不等于知道哪一步该学

Agentic Reinforcement Learning(Agentic RL,智能体强化学习)让策略在多步环境中提出动作,由宿主执行工具并接收新观察,再依据整条轨迹的结果更新策略。难点不只在“奖励稀疏”,还在环境能否重置、哪些 token 真由模型控制、行为策略是否过期,以及高分是否真的代表安全完成。

交互闭环产生证据,训练闭环改变策略。两者之间必须保存版本、动作掩码与旧策略概率;评测通过后才晋升新策略,安全权限门始终留在模型之外。
00 · 范围边界

先分清三件相邻但不等价的事

“用了 PPO / GRPO”并不足以证明系统在做 Agentic RL。关键问题是:策略动作是否真的改变外部环境,并在后续轮次收到由该状态产生的新观察。单轮推理强化学习、在线环境 RL 与离线轨迹偏好可以共享数据或算法部件,但训练合同不同。

路线数据怎样产生最小判断标准
单轮 reasoning RL / RLVRprompt → 一段模型回答 → 规则或 verifier 评分Reinforcement Learning with Verifiable Rewards(RLVR,可验证奖励强化学习)可以训练推理,但若回答期间没有外部状态转移,就不是本文重点的环境交互型 Agentic RL。
在线 Agentic RL观察 → 模型动作 → 环境转移 → 新观察,反复多轮环境可执行、可重置并返回可记录结果;训练数据来自某个可追溯行为策略的 rollout(交互采样)。
离线轨迹偏好 / 模仿从日志或采样池构造 chosen / rejected 轨迹,或筛选成功轨迹做监督微调Direct Preference Optimization(DPO,直接偏好优化)与 rejection sampling(拒绝采样)可改进 Agent,却不要求训练时在线与环境交互,因此不能和在线 RL 画成同一条 advantage 更新链。
修车类比
Supervised Fine-Tuning(SFT,监督微调)像看老师示范;轨迹偏好像比较两种修法;在线 Agentic RL 像让学生在可复位的模拟车间中诊断、取工具、试修、复检。三种方法可以组合,不是互斥的时代标签。
代码任务
读 issue → 搜文件 → 改代码 → 跑测试 → 失败 → 再改 → 通过,是一条轨迹。最终测试通过只证明终态满足这套测试,并没有自动证明“第一次搜索”最关键,更没有证明补丁安全或适合生产。
01 · 环境与轨迹合同

训练样本不是聊天记录,而是一份可重放、可归责的状态转换账本

Agent 常被建模为 Partially Observable Markov Decision Process(POMDP,部分可观测马尔可夫决策过程):环境有真实状态,策略通常只看到 observation(观察)。因此“模型说任务完成了”不是终态;宿主必须从环境、测试或外部收据独立验收。

合同最少保存什么否则会错在哪里
Environment contract
环境合同
task_id、环境 / 工具版本、reset / snapshot、seed、观察与动作 schema、预算不同 rollout 可能从不同状态开始;工具升级后,奖励与动作含义悄悄改变。
Trajectory contract
轨迹合同
episode_id、每轮 observation / action / tool receipt、时间与成本、terminatedtruncated无法判断任务真的结束,还是仅因超时、token 或工具预算耗尽。
Learning contract
学习合同
policy / reward / verifier 版本、动作 mask、旧 log-probability、优势粒度、有效样本标记把环境文本当模型动作训练,或拿过期概率计算错误的 policy ratio。
Evaluation contract
评测合同
留出任务与环境、重复 trial、终态断言、安全 / 成本指标、晋升阈值训练 verifier 的漏洞被当作能力,或一次幸运成功被当作稳定提升。
伪代码

先产生带版本与掩码的轨迹

conceptual rollout record
observation, reset_info = env.reset(seed=seed, snapshot=snapshot_id)

while budget.remaining:
  proposal, action_logprobs = behavior_policy.act(observation)
  action = host_gate.validate_and_authorize(proposal)
  next_observation, reward, terminated, truncated, info = env.step(action)

  trajectory.append(
    observation, action, tool_receipt=info.receipt,
    train_mask=model_controlled_positions(proposal),
    old_logprob=action_logprobs,
    env_version, policy_version, reward_version,
    terminated, truncated, cost=info.cost
  )
  observation = next_observation
  if terminated or truncated: break

这是合同示意,不是某个框架的 Application Programming Interface(API,应用程序编程接口)。Gymnasium 区分 terminatedtruncated:前者表示到达任务定义的终止状态;后者通常来自时间或预算等外部边界。计算 value target 时,两者的 bootstrap 语义可能不同,不能只存一个 done

02 · 梯度掩码

环境结果能影响决策,但不应被伪装成“模型自己说的话”

在 token 策略中,系统提示、用户任务与工具结果会参与前向计算,影响后续 hidden state;但 policy loss(策略损失)的直接目标通常只覆盖模型控制的动作位置。若策略输出的是离散非文本动作,同一原则对应于那组动作分布。

轨迹片段是否通常进入 policy-loss mask原因
系统 / 用户任务否,作为 context由数据或宿主提供,不是策略在这一轮选择的动作。
模型计划或可见 reasoning取决于训练接口若确由策略采样并被定义为动作,可训练;不要假设所有系统都暴露或保存内部推理。
工具名与参数 token通常是它们是模型提出的动作;真实授权与执行仍由 Host Gate(宿主权限门)决定。
原始 tool result / 环境观察否,作为 context来自环境。把它当作模型目标会让概率比、信用和审计归属全部错位。
宿主纠错、人工审批默认否是外部控制信号;若转换为监督数据,应显式进入另一份训练配方与数据版本。
60 / 180 token 小账
若一条序列共 180 token,其中 120 个来自任务与工具观察,60 个是模型生成的计划 / 调用,那么直接策略损失的 mask 和通常是 60,而不是 180。上下文仍通过 attention 影响这 60 个位置的预测;“mask 为 0”表示该位置没有直接动作目标,不表示上下文对梯度毫无影响。
必须绑定行为策略
old_logprob 要与实际采样动作、mask 和 policy_version 同步保存。异步 learner 更新后,旧 worker 仍可能产出数据;没有版本和 staleness(陈旧度)边界,就无法知道 ratio 比较的是哪两个策略。
03 · Credit Assignment

时间上更近、组里更好与因果上关键,是三种不同判断

Credit assignment(信用分配)研究结果信号怎样影响更早的动作。长轨迹里常见四类近似:整轨迹 return、value / GAE、组内相对优势、过程或隐式步骤奖励。它们都能产生训练权重,但没有一种仅凭终局分数就恢复真实因果贡献。

Return / discount · 回报与折扣

把后续奖励按时间累计到先前动作。若只在第 4 步给终局奖励 1,且 γ = 0.9,四步 return 是 [0.729, 0.81, 0.9, 1]。这表达“越远权重越小”的时间偏好,不证明第 4 步比第 1 步更有因果贡献。

Value / GAE · 价值基线

Generalized Advantage Estimation(GAE,广义优势估计)用 learned value 与 bootstrap 在偏差—方差之间取舍。critic 可降低方差,却会引入价值函数误差;被截断轨迹的 bootstrap 还依赖正确终止语义。

Group-relative · 组内相对

Group Relative Policy Optimization(GRPO,组相对策略优化)按同一任务的一组 rollout 比较奖励,省去独立 critic。它提供“哪条轨迹相对更好”的信号;若把同一轨迹优势复制到所有动作位置,仍没有找出哪一步导致成败。

Process / implicit · 步骤信号

Process Reward Model(PRM,过程奖励模型)可直接评分步骤;iStar 则从在线轨迹偏好训练隐式 PRM。信号更细,不等于没有偏差:排序质量、模型假设与分布变化会进入 credit。

GRPO 组内优势手算
同一任务采样 4 条轨迹,最终奖励 [1, 0, 0, 1]。组均值为 0.5,population standard deviation(总体标准差)为 0.5,于是标准化优势为 [+1, -1, -1, +1]。它能提高两条成功轨迹中被 mask 的动作概率、压低失败轨迹,却不能告诉你“搜索、编辑、测试”哪一步关键。若四条奖励全相同,组标准差为 0;实现通常用 epsilon、跳过或 mask 处理,但组内本身不再提供区分信号。
04 · 优化路线

PPO、GRPO、DPO 与筛选式 SFT,不该挤进同一个公式

选算法前先问三件事:数据来自当前策略还是离线池?baseline(基线)来自 value、组均值还是参考策略?更新怎样限制策略漂移?名称相似不代表训练信号可互换。

路线数据与目标Agentic 场景的边界
PPOProximal Policy Optimization(近端策略优化)用行为策略采样,以 clipped surrogate 限制新旧策略 likelihood ratio;常配 value / GAEcritic 与长轨迹 value 估计增加复杂度。PPO 原算法不要求“相对某个 SFT reference 的 Kullback–Leibler divergence(KL divergence,KL 散度)”;Reinforcement Learning from Human Feedback(RLHF,人类反馈强化学习)或 Agent RL 实现可以另加 KL 或其他约束。
GRPO同一任务采样一组轨迹,用组内奖励统计量构造相对优势,不训练独立 critic省去 critic 不等于总成本必然更低:每个任务要多次 rollout;奖励无差异或组不可比时,信号会退化。
DPO / trajectory preference从 chosen / rejected 序列直接优化偏好目标,以 reference policy 约束相对变化训练时不必在线执行环境;把整条轨迹当序列也不会自动产生步骤级因果 credit。iStar 用 multi-turn DPO 训练隐式步骤奖励,是一项具体设计。
Rejection sampling + SFT采样多条,按 verifier 过滤或排序,把保留轨迹当监督数据最大化似然不是 policy-gradient RL;流程简单但会丢失部分失败信息,verifier 漏洞也会被数据筛选放大。
05 · 训练系统

Rollout 常是慢车道;异步化换来吞吐,也带来策略陈旧

模型生成、工具等待与长尾 episode 会让 Graphics Processing Unit(GPU,图形处理器)和环境彼此空等。生产级系统要解耦采样、存储、评分与学习,但每次解耦都必须保住数据完整性和 on-policy 边界。快,不等于可以混用版本。

组件职责关键验收
Rollout workers绑定 behavior policy、环境快照、seed 与预算,执行多轮任务每轮可追溯;沙箱可复位;超时和截断显式记录。
Trajectory store保存动作、观察、收据、mask、old logprob、成本与全部版本缺字段 / 重复 episode / 跨版本拼接应被拒收,而不是静默补齐。
Verifier stack检查环境终态、过程约束、格式、安全与成本奖励版本化;训练 verifier 与独立验收器分开;保留原始证据。
Credit + learner构造 return / advantage,执行 PPO、GRPO 或其他策略目标只更新有效动作位置;限制 staleness、ratio、梯度与策略漂移。
Holdout evaluator在留出任务、环境版本与对抗案例上跑候选策略未过任务、安全、成本和回归门,不得晋升到下一轮或生产。
Agent Lightning
2025 年论文把 agent execution 与 RL trainer 解耦。官方说明的对比图明确:传统拼接式 multi-step GRPO 要忽略非 Large Language Model(LLM,大语言模型)生成 token;LightningRL 则把多步运行拆成每次 LLM call 的 input、context、output 与 reward transition。两种表示都先定义动作归属,再计算 loss;这不意味着所有 Agent 框架天然有正确掩码。
DORA · 2026 preprint
Dynamic ORchestration for Asynchronous Rollout(DORA,异步 rollout 动态编排)根据既有工作指出,实践中 rollout 可能占训练 step 时间的 50%–80%;其 128 张 GPU 开源实验报告最高 2.12× 端到端吞吐,从同步基线 16,070 提升到 34,135 tokens/s,工业场景另自报 2–4×。论文把 intra-trajectory policy consistency、数据完整性与 bounded staleness 列为约束;这些是预印本特定设置的作者自报结果,不是任意集群的通用倍数。
安全不能只做 reward 项
删除、支付、发信、生产发布等动作必须由策略外的身份、权限、schema、预算、沙箱与审批硬门控制。Reward 可以鼓励合规,却允许与成功分数权衡;确定性控制面负责“不允许发生”。执行恢复与副作用语义见 Agent 可靠执行
06 · 一手论文案例

论文分数证明特定设置有效,不证明“Agentic RL 已通用解决”

以下数字均限定在论文版本、模型、脚手架与 benchmark;截至 2026-07-14,不把发布方自评、预印本或单一任务集外推为生产能力。

案例论文内证据应该怎样读
WebAgent-R1
Conference on Empirical Methods in Natural Language Processing(EMNLP)2025
用在线网页交互、多样异步轨迹与 binary task-success reward 做端到端多轮 RL;WebArena-Lite 中 Qwen-2.5-3B 从 6.1% 到 33.9%,Llama-3.1-8B 从 8.5% 到 44.8%这是同论文设置下的显著增益,支持环境交互 RL 的可行性;不等于开放网页上的通用成功率。
Agent-RLVR
2025 preprint
用 guidance 与 environment rewards 处理软件工程 Agent 的稀疏奖励;Qwen2.5-72B-Instruct 在 SWE-bench Verified 的 pass@1 从 9.4% 到 22.4%,再配 test-time reward model 报告 27.8%指导信息改变训练分布,test-time reward model 也改变推理预算;三个数字不能当成“只换 RL 算法”的纯消融。
iStar
International Conference on Learning Representations(ICLR)2026
从在线正负轨迹对用 multi-turn DPO 训练 implicit PRM,再根据相对旧 policy snapshot 的变化产生步骤奖励;论文评测 WebShop、VisualSokoban 与 SOTOPIA说明步骤 credit 可以从轨迹偏好间接学习;它仍依赖排序、旧策略快照和实验环境,不是通用标准件。
RAGEN
2025 preprint
在多轮环境中研究 State-Thinking-Action-Reward Policy Optimization(StarPO,按正文首次定义),并报告 Echo Trap:奖励方差快速塌缩、梯度 spike,以及在缺少细粒度 reasoning-aware reward 时出现浅层策略这是论文在其风格化环境中的训练现象,适合提醒监测奖励多样性与初始状态覆盖,不应写成所有 Agent RL 的定律。
Kimi K2
报告 v2 · 2026
报告描述 agentic data synthesis 与 general / joint RL;历史 non-thinking 设置下报告 Tau2-Bench 66.1、ACEBench(En) 76.5、SWE-bench Verified 65.8工具合成流水线中的 3,000+ 真实 Model Context Protocol(MCP,模型上下文协议)规格与 20,000+ 合成工具主要用于 SFT 数据构造,不能说成“20,000 个工具都参与 RL rollout”;分数也绑定该版本与 scaffold。
DeepSeek-R1
边界案例
R1-Zero 展示不先用 SFT cold start 的 reasoning RL;正式 R1 加入 cold-start、RL、rejection sampling 与 SFT 等多阶段它证明可验证单轮推理 RL 的能力,不是外部工具环境多轮 Agent RL 的直接证据。“纯 RL”只适用于 R1-Zero 的特定起始路线,不适用于正式 R1 全流程。
07 · 评测与发布门

先证明高分代表真实完成,再证明提升能跨任务复现

训练 reward 是学习信号,不应兼任唯一裁判。评测器至少要与训练 verifier 有独立实现或独立数据,并读取最终环境状态、工具收据与安全日志;只让另一个模型评价“轨迹看起来不错”不够。

成绩单建议指标失败时说明什么
Outcome独立终态断言、pass@1、任务完成率、部分完成分层策略没有真正改变到目标状态,或 verifier 奖励了表面证据。
Generalization留出任务、未见初始状态、工具 / 环境版本变化记住了任务模板、测试漏洞或训练环境特征。
Reliability多 seed / 多 trial 均值与区间、连续成功、截断率、恢复率单次成功掩盖高方差、长尾失败或预算敏感。
Safety越权请求率、硬门拦截率、重复副作用、注入与奖励黑客测试任务分数通过牺牲权限、数据完整性或业务约束获得。
Efficiencytoken、rollout 数、工具次数、GPU / 环境时长、端到端成本质量提升可能只是花了更多采样与 test-time compute,而非策略效率提升。

训练前

冻结任务与环境版本;建立可重置 snapshot;按模板、仓库、网站或用户实体做防泄漏切分;先验证 verifier 与真实终态一致。

训练中

监控 reward 分布、全同奖励组、截断、policy staleness、invalid action、重复 episode、工具错误、成本和梯度 spike。

晋升前

用留出环境重跑;人工审计高分与失败轨迹;过安全、能力回归和成本门;保留旧策略与一键回滚路径。

08 · 来源

一手论文、官方文档与口径边界

主题一手来源本文使用范围
环境终止语义Gymnasium Basic UsageHandling Time Limitsreset / step 与 terminated / truncated 区别。
PPO / GAEProximal Policy Optimization AlgorithmsGeneralized Advantage Estimationclipped objective、value baseline 与偏差—方差边界。
GRPO / DPODeepSeekMath(GRPO)Direct Preference Optimization组内相对优势与离线偏好目标的机制差异。
Web Agent RLWebAgent-R1 · EMNLP 2025WebRL在线网页 rollout、二元任务奖励与自演化 curriculum 案例。
代码 Agent RLAgent-RLVRguidance、环境奖励与 SWE-bench Verified 论文设置。
步骤 creditiStar · ICLR 2026RAGEN隐式步骤奖励与多轮 RL 训练动态;RAGEN 为预印本。
训练系统Agent LightningMicrosoft Research 说明DORA执行—训练解耦、动作 mask 与异步 rollout;DORA 数字为预印本自报。
模型案例Kimi K2DeepSeek-R1历史 agentic benchmark、数据 / RL 阶段与 reasoning-RL 边界。

核查日期:2026-07-14。论文指标只用于还原对应实验,不作为当前产品排名;预印本与发布方自评均已在正文显式标注。