状态传导图
全部历史原样塞入通常更贵也更乱,关键 ID、确认凭证和收据要另存结构化状态。
观察点 01
从真实状态重建本轮最小可信工作集
Host 从目标与验收条件、版本化 workflow state、带来源证据、工具 Schema 和预算中选出 context packet。给模型的权限提示只是投影,真正授权仍由执行平面强制检查。
- 上下文相关性主动筛选
- 历史原样堆积被压缩
上下文工程决定模型看到什么;它不能替代状态存储或权限系统。
Agent 的稳定接口是“状态—动作—观察—验收”。模型选择候选下一步,程序负责授权和副作用,真实结果写回 workflow state;连续输出思维并不会自动变成可靠 Agent。
状态传导图
全部历史原样塞入通常更贵也更乱,关键 ID、确认凭证和收据要另存结构化状态。
观察点 01
Host 从目标与验收条件、版本化 workflow state、带来源证据、工具 Schema 和预算中选出 context packet。给模型的权限提示只是投影,真正授权仍由执行平面强制检查。
上下文工程决定模型看到什么;它不能替代状态存储或权限系统。
状态传导图
确认应绑定 call ID、关键参数和时效;服务端执行前还要按最新状态复核。
观察点 02
模型可提出回答、tool call 或子任务。外部副作用必须依次通过 Schema、主体与资源授权、风险确认、预算和幂等检查,才由最小权限执行器运行。
Tool call 是候选动作;通过所有门以后,Executor 才真正改变环境。
状态传导图
Checkpoint 可以帮助恢复,但不能盲目重放已经完成的付款、发布或删除。
观察点 03
执行结果、错误、来源和收据写入工作流状态,旧历史可以压缩,并在安全点保存 checkpoint。失败与拒绝也必须进入状态,下一轮不能假装世界没变。
Observation 只有进入状态,Agent 才真正从行动结果中继续工作。
状态传导图
同一任务应运行多个 trial,并同时记录成功率、连续成功、恢复、延迟和成本。
观察点 04
完成提案进入独立验收门:检查数据库或文件等真实终态、证据覆盖、输出契约与策略轨迹。终态未满足就记录缺口继续;越权轨迹不能被正确答案抵消。
最终文本、环境结果与轨迹合规是三张不同成绩单。
你现在应该能解释:最终文本、环境结果与轨迹合规是三张不同成绩单。
Agent(智能体)不是一颗会自动驾驶的“大脑”,而是一套运行时系统:模型提出回答、工具调用或子任务,程序校验权限并执行,把真实结果写回状态,再决定继续还是验收。自主性来自可选择下一步,可靠性来自模型之外的控制面。
模型本身产生输出;宿主程序把结构化工具调用转换成真实操作,再把结果交回模型。Agent 指的是这套模型 + 工具 + 状态 + 控制循环系统:模型可在授权范围内选择下一步,但每个外部副作用仍由程序执行与约束。
许多工具型 Agent 都可抽象成一个循环:根据状态提出下一步、执行获批动作、读取真实观察,再判断继续或停止。经典 ReAct(Reasoning and Acting,推理与行动交错)论文用显式文字推理轨迹与动作/观察交错;现代系统不必暴露完整思维链,固定 workflow、planner-executor 和隐藏推理模型也能实现同一运行时接口。
| 契约 | 必须明确什么 |
|---|---|
| Task 任务 | 目标、输入、允许的范围,以及失败时怎样退出 |
| State 状态 | 步骤、版本、pending/done、确认凭证与已产生的收据;不是一段模糊聊天摘要 |
| Action 动作 | 工具名、JSON Schema、风险级别与可重试语义;模型输出只是候选动作 |
| Observation 观察 | 真实结果、错误、来源、时间和执行收据;不可信工具内容仍按数据处理 |
| Control 控制 | 授权、确认、预算、超时、取消、幂等与人工接管 |
| Completion 验收 | 用环境终态和证据判断完成;不能只看 Agent 是否输出“已完成” |
下面的“大脑、工具、记忆、规划”是便于入门的功能拆分,不是所有框架都采用的标准四层架构;生产系统还会单列状态机、权限、预算、观测与评测。
根据当前状态提出下一步、工具参数或最终回答。端到端能力不只取决于模型,还取决于工具质量、上下文、控制器和验证。
搜索、代码、数据库、API(Application Programming Interface,应用程序接口)与 RAG 等能力通过名称、参数 Schema 和返回结构暴露。function calling(函数调用)只让模型按格式提出调用,执行仍在模型之外。
workflow state保存当前步骤和副作用收据;对话历史保存交互;可选的持久记忆保存获准跨会话使用的偏好、事实或案例。三者生命周期与一致性要求不同。
把目标拆成带依赖、前置条件和验收标准的可修改假设。每次观察都可能让旧计划失效,因此生产系统还要支持重规划、取消和人工接管。
tool_call 是提案,不是授权。幂等键必须在副作用之前生效:同键同意图/参数返回首次收据和结果,同键不同意图/参数才报冲突。网络超时后用同一键查询或安全重试,不能让模型猜“成功还是失败”;审计可回查,但不代表可以重放副作用。长任务的失败可能来自决策模型,也可能来自状态丢失、上下文噪声、错误记忆或工具结果未校验。把全部历史塞回去并不等于“记得好”;关键是保存可验证状态,并在需要时选回正确版本的信息。
记住「是什么」:经用户同意保存的偏好、组织事实、实体关系。
例:profile 记录「用户是素食者」,并附来源与更新时间。
记住「过去怎么做的」:成功/失败的任务轨迹、案例。
例:「上次修这个 repo 先跑 pytest 再改」。
描述「该怎么办事」:系统提示、工具规范、规则文件或学到的策略。配置文件本身更准确地说是外部指令,不等同于模型权重里学会了技能。
| 实现 | 适合保存什么 · 关键风险 |
|---|---|
| Workflow state / checkpoint | 订单号、当前步骤、执行收据、幂等键;强调事务一致性与可恢复,但恢复时不能把已完成副作用当作普通文本重新播放 |
| 结构化 profile | 用户明确同意保存的偏好与属性;字段要有来源、更新时间、删除与覆盖规则 |
| 向量/全文检索 | 从长历史或案例库找相关片段;召回可能遗漏,也可能取回旧事实,需保留时间与 provenance |
| 时间图 / 事件日志 | 表达“谁在何时做了什么”及事实有效期;适合跨事件推理,但构建、纠错和权限管理更复杂 |
论文例子:MemGPT 把有限上下文与外部存储类比为分层内存;Mem0 的 arXiv 论文在 LOCOMO 的特定 full-context 基线对比中报告 p95(第 95 百分位)延迟低 91%、token 成本省逾 90%。这些数字取决于其基线、模型与实现,不是“接入记忆层”必然得到的收益。
范式选择取决于任务依赖、可验证性、并行度与预算。能用确定性 workflow 解决时通常更容易测试;开放任务才值得付出动态 Agent 的额外延迟、成本与不确定性。
| 范式 | 核心思路 |
|---|---|
| ReActReasoning and Acting | 原论文让显式文字推理轨迹与动作、观察交错;工程上可保留状态/动作/观察接口,而不要求展示完整思维链 |
| Plan-and-Execute先规划后执行 | 先产生可修改计划,再逐步执行和重规划;适合依赖关系较清楚的任务,但初始计划可能错,额外规划调用也增加成本 |
| Reflexion自我反思 | 失败后反思「哪错了」并写进记忆,下次重试时改进(只写进记忆提示,不更新模型权重) |
| ToTTree of Thoughts 思维树 | 显式探索、评估并回溯多个中间候选;原论文在特定难题上展示收益,代价是更多采样与评估,并非所有 Agent 都需要树搜索 |
| Multi-Agent多智能体协作 | 把可并行方向交给多个独立上下文。Anthropic 报告其 Claude Opus 4 主 Agent + Claude Sonnet 4 子 Agent研究系统在内部 research eval 比单 Agent Opus 4 高 90.2%,而多 Agent 相对普通 chat 约用 15× token;依赖密集的编码任务不一定适合,数字也不能外推到任意架构 |
| 工具标准化MCP · Model Context Protocol 模型上下文协议 | MCP 标准化 client/server 间对 tools、resources、prompts 等能力的发现与调用;它减少接口适配,不自动解决授权、安全或业务编排 |
| 怎么变强Agentic Reinforcement Learning | 更强 Agent = 模型侧(推理/工具使用训练,含 Agentic RL) + 系统侧(工具/记忆/规划/上下文工程/评测/安全),不是只靠 RL |
一次评测至少包含 task(任务)、trial(一次试验)、agent harness(运行时封装)、environment(环境)和 grader(判分器)。模型、提示、工具和控制循环共同构成被测系统;只公布模型名,结果通常不可复现。
| 层 | 看什么 | 一个可执行指标 |
|---|---|---|
| Outcome 终态 | 环境是否真的满足验收条件,证据和收据是否一致 | 任务成功率、字段级状态差异、测试通过率 |
| Trajectory 轨迹 | 工具、参数、顺序、来源与策略是否合规;是否出现越权尝试 | 禁止动作数、参数准确率、证据覆盖率 |
| Reliability 可靠性 | 同一任务多次运行是否稳定,而非只挑一次成功样本 | 多次 trial 的均值、区间,以及连续成功率 |
| Recovery 恢复 | 超时、限流、工具报错、过期确认和中断后能否安全继续 | 恢复成功率、重复副作用数、人工接管率 |
| Resources 资源 | 为了成功花了多少模型、工具、时间与人工预算 | token、工具调用数、p50/p95 延迟、单次成功成本 |
0.8⁴=40.96%。这只是说明稳定性压力的手算例子,真实试验会受任务相关性影响;τ-bench 因此使用 pass^k 看 k 次试验全部成功的比例,而不是只报“至少成功一次”。| 基准 | 主要环境与判分边界 |
|---|---|
| SWE-bench | 来自 12 个 Python 仓库的 2,294 个真实 GitHub issue;在代码仓库中修复问题,以测试执行判分 |
| τ-bench | 动态模拟用户、领域 API 与策略约束;比较最终数据库状态,并用 pass^k 衡量一致性 |
| GAIA | 通用助手问题,要求组合推理、多模态、网页浏览与工具使用;不等于业务写操作评测 |
| OSWorld | 369 个真实计算机环境任务,以执行后的应用状态判分;不等于开放世界所有桌面工作 |
| AgentDojo | 97 个现实任务与 629 个安全测试用例,把工具数据中的提示注入与正常任务效用一起测试 |
Agent 的可靠性来自模型与系统共同设计。下面这些风险会随任务、权限和工具而变化,不能只靠“换更强模型”解决。
长程任务一步错、步步错——粗略假设每步独立、95% 对且任一步错即失败,10 步成功率≈0.95¹⁰≈60%。越长越脆(真实中有重试/校验会偏离这个简化)。
缓解:缩短链路、加校验/反思、关键步人工确认。
参数填错、调用不存在的工具、误解返回值。
缓解:清晰的工具说明、参数校验、错误重试。
每步都调一次大模型,多轮下来又慢又贵。
缓解:小模型分流、缓存、限制步数。
长任务把历史全堆进上下文,又长又贵还「读不准」。
缓解:上下文压缩、长期记忆(检索)、分段总结。
Agent 能产生真实副作用,网页、邮件或文档中的间接提示注入可能诱导其泄露数据或误用工具。CVE-2025-32711(EchoLeak)的 CVE(Common Vulnerabilities and Exposures,通用漏洞披露)与 NVD(National Vulnerability Database,美国国家漏洞数据库)记录确认了 M365 Copilot 中可经网络导致信息泄露的 AI command injection,且不需用户交互。
缓解:最小权限、数据流限制、沙箱、写操作确认、参数校验、allowlist 与审计;尽量不要让同一执行体同时拥有“读私密数据、读不可信内容、无约束对外通信”。
只看最后一句或只跑一次,会漏掉环境未生效、轨迹越权和偶发失败;只换模型却改变 harness、工具或环境版本,也无法公平归因。
缓解:按五层评测面板固定任务、环境、运行时和判分器版本,保存轨迹与收据并重复试验。
| 问题 | 答案 |
|---|---|
| Agent 是什么 | 模型在程序控制的循环中选择下一步、调用获批工具、读取结果并更新状态的系统 |
| 和普通模型调用的区别 | 宿主程序会把结构化调用变成外部行动,并在预算、权限和停止条件内继续多步执行 |
| 核心循环 | 状态 → 候选动作 → 受控执行 → 观察 → 验收/继续;ReAct 是经典实现之一,现代系统也可用固定 workflow 或 planner-executor |
| 常见功能组件 | 决策模型 · 工具 · 状态/记忆 · 规划;生产系统还需权限、预算、观测和评测 |
| 进阶范式 | Plan-and-Execute、Reflexion、ToT、Multi-Agent |
| 和别的主题 | MCP 可标准化能力接口 · RAG 可作为检索组件 · Agentic RL 是训练工具使用/决策能力的一类方法,不是唯一来源 |
| 怎样判断完成 | 核对环境终态和证据,再单独检查轨迹合规;模型输出“完成”只是一项提案 |
| 最大的坑 | 累积误差、状态过期、重复副作用、成本延迟、提示注入和只看最终文本的错误评测 |
本页于 2026-07-14 核查。Agent 产品、模型和榜单变化很快,因此正文优先引用可迁移的运行时机制;厂商内部 eval、论文实验与动态能力趋势都只按明确的模型、基线、任务和更新时间引用。
| 主题 | 一手来源 | 本页如何使用 |
|---|---|---|
| Agent / workflow | Anthropic: Building effective agents;Trustworthy agents in practice(2026-04-09) | 区分预定义 workflow 与模型动态决定过程的 agent;自主性不等于权限或可靠性 |
| ReAct | Yao et al., ICLR 2023 | 原论文交错显式文字推理轨迹与动作/观察;本页不把暴露完整思维链说成现代 Agent 的必要条件 |
| 工具执行契约 | Claude Platform: How tool use works;OpenAI Agents SDK: Human-in-the-loop | 模型发出结构化请求而不自行执行;敏感调用可按 call ID 暂停、批准/拒绝和恢复 |
| 幂等与安全重试 | AWS Builders’ Library;Stripe: Idempotent requests | 幂等键在副作用前绑定同一意图;网络结果未知时用同一键查询或重试,而不是生成新请求 |
| 规划与反思 | Reflexion;Tree of Thoughts | 说明 Reflexion 的语言反馈写入上下文记忆而非更新权重;ToT 是带搜索预算的实验方法 |
| 记忆系统 | MemGPT;Mem0(arXiv);REMem(ICLR 2026) | 分层内存是类比;延迟、token 与情景记忆增益都限定在各论文的基线和任务内 |
| 上下文工程 | Anthropic: Effective context engineering;Claude Platform: Manage tool context;OpenAI Agents SDK: Sessions | 每轮重建最小高信号工作集;tool search、缓存、context editing 解决不同 token 压力;对话历史与业务 state 不是同一层 |
| 长上下文 | Lost in the Middle, TACL 2024 | 在论文测试的多文档问答和键值检索中,相关信息位置会影响利用效果;不外推统一跌幅 |
| 多智能体 | Anthropic 工程报告 | 限定 Opus 4 主 Agent、Sonnet 4 子 Agent、内部 research eval 与相对普通 chat token 口径 |
| 安全 | NVD: CVE-2025-32711;Microsoft 安全公告;OWASP LLM06:2025 Excessive Agency;AgentDojo, NeurIPS 2024 | 用已登记漏洞说明网络信息泄露;按最少功能、最小权限和完整授权中介缓解过度代理,并用 AgentDojo 同测正常效用与提示注入 |
| Agent 评测方法 | Anthropic: Demystifying evals for AI agents(2026-01-09) | 采用 task/trial/grader/trace/outcome/harness 定义,多次试验,并把模型与 agent harness 作为整体评估 |
| 能力基准 | SWE-bench;τ-bench;GAIA;OSWorld | 分别限定为代码修复、策略约束业务交互、通用助手和真实计算机环境,不引用快速变化的榜首分数 |
| 任务时长趋势 | METR Time Horizon 1.1 | 截至 2026-05-08,解释 50% horizon 的人类任务时长口径、任务领域范围,以及当前 >16h 测量不可靠 |