跳到正文
动手理解 · CONCEPT LAB

把一句模糊要求变成可评测、受控的运行时协议

Prompt 负责表达任务,Context 负责组装规则、证据与状态;模型只生成提案,程序硬门决定它能否成为答案或真实动作。

已经发生 正在观察 接下来
01 / 04

状态传导图

ASK 模糊要求
GOAL 目标缺失
CTX 证据缺失
FORM 格式缺失
OUT 结果靠猜

橙色节点代表缺失信息;补词藻不能替代补任务条件。

观察点 01

“帮我分析一下”没有告诉模型何谓完成

模型只能猜目标、读者、证据范围和输出形式。即使答案流畅,也很难判断它是否满足真实任务。

模型自由度非常高
结果可验证性很低
此刻要记住

模糊 Prompt 最大的问题不是短,而是缺少可验收标准。

应用 · Prompt 工程 / Prompt Engineering

Prompt 工程:把任务写成可评测的运行时协议

Prompt(提示词)负责表达目标、约束与交付格式;Context Engineering(上下文工程)负责决定本次调用还要带上哪些规则、证据、状态、历史与工具定义。模型输出仍只是概率性提案——事实校验、权限和真实副作用必须由程序控制。

一张图先抓住边界:Prompt 是任务说明,Context 是本次工作记忆,模型生成提案;真正的授权、验证和执行控制仍在模型外。
01 · 定位

Prompt 重要,但它只负责一部分控制

同一个模型面对不同指令和上下文,输出可能不同;差多少取决于任务、模型版本、上下文材料、推理预算、采样参数和评测方式。先分清两类工程问题。

Prompt Engineering
任务、受众、约束、验收标准和输出契约表达清楚;必要时给少量对齐决策边界的示例。它主要减少“模型要猜什么”的空间。
Context Engineering
为这次调用选择并组织高优先级规则、用户输入、检索证据、会话状态、工具结果和工具定义,同时保留来源、时效与信任边界。不是把所有可用文本都塞进去。
控制权边界
模型看到“只允许退款 100 元”不等于系统已经限制到 100 元;用户说“我确认”也不等于身份和订单授权已经通过。身份、ACL(Access Control List,访问控制列表)、参数范围、二次确认、幂等和审计要由模型外代码执行。消息优先级有帮助,但不是安全隔离。
02 · 结构

把愿望改写成一份任务协议

不用机械填满模板;先补齐会改变答案或验收结果的信息。下面是检查清单,不是固定咒语。

任务比较本季度与去年同期,并总结 3 个变化目标:要做什么,什么算完成
受众 / 视角给不懂会计的产品负责人阅读比空泛“扮演专家”更可操作
证据范围只使用附表 A、B;注明币种和报告期来源、版本、时效、不足时怎么办
约束不推断未披露原因;每条不超过 60 字禁止项、优先级、表达边界
输出契约JSON:metric / delta / evidence_id字段、类型、完成 / 失败状态
示例正例 + 易混淆反例各 1 个Few-shot:按需对齐决策边界

角色主要帮助设定受众、视角或语气,不会自动增加专业正确性。用 ###"""、XML 或 JSON 分隔指令与数据有助于模型解析;但第三方网页、邮件、RAG 片段和工具结果仍是不可信数据,分隔符不会把它们变成安全指令。

03 · 核心技巧

最常用的几招

技巧怎么用 / 何时用
Zero-shot零样本直接给清晰指令、不给范例。把它作为低成本基线;是否足够要看回归集,不由任务“看起来简单”决定
Few-shot少样本(给范例)给少量「输入→输出」范例,让模型在当前上下文中模仿标签、格式或决策边界;这是In-Context Learning(上下文学习),当前调用不会更新模型权重。示例应覆盖容易混淆的边界,否则模型也可能稳定模仿偏差
CoTChain-of-Thought 思维链提示Kojima 2022 的零样本短语与 Wei 2022 的带推理示例在论文所测算术、符号和常识推理任务上带来提升;效果不保证跨模型、跨任务复现。当前部分推理模型的官方建议反而是保持提示直接、避免要求完整思维链;生产系统可要求可核对的依据、计算或引用
指定输出格式Output Format自然语言说明要 JSON、表格、分点或字数,适合人读交付;若下游代码要消费,还需 schema 和程序校验
结构化输出Structured Outputs / JSON Schema支持时,用 JSON Schema/function calling 约束结构比自然语言要求 JSON 更可靠。OpenAI 公布的 100% 是 gpt-4o-2024-08-06 在其复杂 schema eval 上的结构遵守率;它不保证字段值正确,且有 schema 子集、拒绝与截断等限制
分隔符 + 结构化Delimiters###/"""/XML/JSON 区分指令、上下文和数据,帮助模型解析;它不改变来源可信度,不可信数据仍可能包含恶意指令
Self-Consistency自洽性(多路径投票)原论文在推理题上采样多条路径并聚合答案,常优于单条贪心 CoT;它增加推理成本,而且“多数一致”仍可能多数都错

其他论文方法包括 Least-to-Most Prompting(从更简单子问题逐步求解)和 Step-Back Prompting(先提炼更高层概念或原则再解具体题)。它们是带特定模型、数据集与预算的实验方法,不是所有新模型都需要的固定前缀。

Self-Consistency 手算
同一道算术题采样 5 次,最终答案是 [42, 41, 42, 42, 43],多数票为 42(3/5)。这只说明样本间更一致;若题目或提示系统性误导,5 次都答 41 也会得到“高度一致的错误答案”。因此仍要用标准答案或可执行校验器验证。
03.5 · 推理模型时代

推理模型:从「写咒语」到「给任务协议」

带内部推理或可调 effort 的模型,通常更适合接收目标、必要证据、硬约束、输出契约和验收标准,而不是被规定一条僵硬的思考脚本。授权策略可以告诉模型何时停止或申请确认,但真正的权限硬门仍由程序执行。参数名称和档位变化很快,必须查看具体模型版本的官方文档。

🎛️ 推理模型的新「控制面板」

旋钮作用 · 怎么用
reasoning.effortOpenAI API控制模型愿意投入多少推理计算。截至 2026-07-14,GPT-5.6 官方指南列出 none/low/medium/high/xhigh/max,并建议从代表性任务实测档位;这只是该家族当前口径,不能复制给所有型号或厂商
output_config.effortClaude APIAnthropic 将 effort 定义为影响文本、思考和工具调用总体 token 花费的行为信号,不是严格 token 预算;当前文档列出的 low/medium/high/xhigh/max 也并非每个型号都全部支持,adaptive/manual thinking 方式同样依型号变化
输出长度Output budget最终答案长度与内部推理投入不是一回事。可用 max_output_tokens/max_tokens 防止无限输出,再在输出契约中说明需要的详略;截断时要检测完成状态
行动预算Agent limits把“最多几次工具调用、哪些操作需确认、何时停止/转人工”写进协议并由程序执行。prompt 中一句“做彻底”不能替代超时、权限、幂等与审计控制
三条可迁移原则
先给目标与验收标准:说明什么算完成、要引用什么证据、输出字段如何验证。OpenAI 当前推理模型指南明确建议提示简洁直接,并称“think step by step”之类完整思维链要求没有必要;其他模型仍要按各自文档与评测决定。
消除冲突并标优先级:例如“必须在 50 字内详尽解释”本身冲突,应明确哪个约束优先。
把版本当依赖:可用时固定 snapshot;否则至少记录实际模型 ID、请求参数、prompt 版本与时间并回归测试。一个直观反例是:DeepSeek 当前 thinking mode 文档说明 temperaturetop_p 等参数即使传入也不会生效,因此旧模型卡的采样建议不能机械套到当前 API。
🆚

实战:烂 prompt → 好 prompt

客服「取消订单」
❌ 烂 prompt
「帮用户取消订单,尽快处理。」
没说怎么验证身份、查不查订单状态、退款规则、要不要用户确认、何时转人工——推理模型只能瞎猜,要么乱来、要么反复追问。
✅ 任务协议 + 程序硬门
模型协议:先用只读工具查询订单;展示订单号、金额、退款方式与影响;未获得针对该订单的明确确认时,只能解释或转人工。
程序硬门:取消接口独立校验登录身份、订单归属、最新状态、确认凭证、金额范围与幂等键;模型只能提交参数,不能给自己授权。
结果:成功返回服务端凭证;失败返回机器可读原因,不让模型把“已提议”说成“已完成”。
🪄 让模型帮你改 prompt(meta-prompting)
可以把失败的 prompt + 期望行为 + 实际错在哪交给模型,请它提出最小修改。模型或自动优化器只能生成候选,不能证明更好——必须在留出的回归集上比较,并人工检查安全边界。
04 · 进阶

进阶:让 Prompt 更靠谱、更工程化

工程化 Prompt 的核心是“可复现地比较”:固定可固定的依赖、记录其余版本,让自动与人工评测共同驱动最小修改;通过离线门槛后仍需灰度、监控与回滚,线上失败再沉淀回回归集。
推理提示「因模型而异」 Reasoning Models

不要把“必须一步步想”或“绝不展示步骤”写成普遍规律。在同一评测集上比较:直接回答、要求简短依据、给分解示例、调整 effort。固定可用 snapshot,或记录实际模型版本;最终保留能提升可验证结果且成本可接受的方案,升级后重跑。

自动提示优化 DSPy / GEPA

DSPy把语言模型流水线表示为可优化模块,MIPROv2(Multiprompt Instruction Proposal Optimizer Version 2)可联合搜索指令与 few-shot 示例;GEPA(Genetic-Pareto)读取执行轨迹、用自然语言反思并演化提示。GEPA 论文 v2 在 6 个任务设置中报告,相对其 GRPO(Group Relative Policy Optimization,组相对策略优化)基线平均高 6%、最高高 20%,最多少 35× rollout(轨迹采样)——这是论文内对比,不是所有任务的保证。
⚠️ ACL 2026 Student Research Workshop 正式论文 VISTA 在一个故意有缺陷的 GSM8K seed 上报告 GEPA 从 23.81% 降到 13.50%。这说明优化器需要开发集、独立测试集、重复运行和回滚,而不是“自动必升”。

当成工程,不是玄学 Prompt as Engineering

提示词要版本管理、建评测集、做成对比较。例:20 条固定用例中,旧 prompt 对 14 条(70%),新 prompt 对 17 条(85%):是提高 15 个百分点,相对错误数从 6 降到 3(减少 50%)。样本很小,不能据此宣称线上也提升 15%;还要看错误类型、置信区间和更大留出集。OpenAI 当前评测指南也明确反对只凭“感觉能用”,并建议持续把生产与历史失败加入评测。

当心提示注入 Prompt Injection

用户输入、网页、邮件、OCR 或工具结果里可能藏恶意指令;后四类属于常见的间接提示注入入口。分隔或“忽略恶意指令”无法构成可靠防线;还需最小权限、敏感数据流控制、工具参数校验、高影响操作确认与审计(见 Agent 安全MCP)。
📰 CVE-2025-32711(EchoLeak)的 NVD 记录描述 M365 Copilot 中可经网络导致信息泄露的 AI command injection;其 CVSS 向量为 UI:N(无需用户交互)。它说明消息优先级不能替代产品级隔离。

05 · 常见误区

Prompt 的 6 个常见误区

模糊不具体 Too Vague

「帮我优化一下」——优化什么、目标是啥、给谁看?模型只能猜。

:把目标、对象、标准说清楚。

又长又绕 Bloated

堆一大段废话和「非常重要!!」,反而稀释了关键指令。

:精简、结构化、要点优先。

不给输出格式 No Format

不说要什么格式,拿到一堆没法用的自由文本。

:明确 JSON/分点/字数/字段。

一次问太多 Overloaded

一个 prompt 塞五个任务,模型顾此失彼。

:拆成多步/多次,或用 Agent 编排。

忽略模型差异 Model Differences

不同模型「脾气」不同,同一 prompt 效果不一(尤其推理模型)。

:按目标模型调,换模型要复测。

该用别的手段时硬靠 prompt Wrong Tool

缺少可更新知识时可评估 RAG;需要大量重复样例才能稳定行为时可评估 微调;需要机器可验证结构时优先用 schema/代码校验。它们也常与 prompt 组合。

:先定位失败来自知识、指令、模型能力、工具还是验证,再选干预手段。

速查表

一张表回顾 Prompt 工程

问题答案
本质是什么Prompt 是可测试的任务协议;Context 是本次调用的工作记忆;程序保留验证与执行控制
好 prompt 结构任务 + 受众/视角 + 证据范围 + 约束 + 输出契约;示例按需加入
先改什么先消除任务歧义、冲突和不可验证标准,再通过评测决定是否加示例或推理提示
核心技巧Few-shot 提供模式;CoT/分解提示与 Self-consistency 在部分推理任务有效,但要付出 token 并验证
推理模型特别注意参数和最佳提示依具体模型版本而变;优先给目标、证据与验收标准,是否要求显式步骤用评测决定
工程化版本管理 + 固定回归集 + 自动/人工评测 + 灰度/回滚;DSPy/GEPA 可生成优化候选
最大误区把 prompt 当咒语、事实证明或权限系统;以及该用 RAG/微调/代码校验时仍只改措辞
来源与核查

原论文与当前官方文档

本页于 2026-07-14 核查。提示技巧论文回答“在作者的模型与任务上发生了什么”;动态产品文档只回答“这个型号在核查日支持什么”。二者都不能代替你自己的回归评测。

主题一手来源核查结论
Prompt 与 ContextOpenAI Text generationAnthropic Context windows消息角色、工具结果、历史和工具定义都可能进入上下文;具体角色名与序列化依 API 而异,不能把整份 context 都叫“用户 prompt”
Few-shot / ICLBrown et al., 2020GPT-3 论文的 few-shot 任务和示例通过文本上下文给出,没有梯度更新;不等于任何范例都会提升当前模型
CoTWei et al., 2022Kojima et al., 2022分别支持少样本 CoT 与零样本短语在论文任务上的结果,不外推为所有模型必升
推理提示方法Self-ConsistencyLeast-to-MostStep-Back Prompting这些是带模型、数据集和推理预算的实验方法,不是固定咒语
Structured OutputsOpenAI 原始发布说明当前官方指南100% 是 gpt-4o-2024-08-06 在官方复杂 schema eval 上的结构遵守率;值仍可能错,也有 schema 子集、拒绝与截断等边界
OpenAI 推理模型Reasoning best practicesGPT-5.6 当前指南官方当前建议保持提示简洁直接、避免无必要的完整 CoT 要求;GPT-5.6 当前 effort 为 nonemax,不能外推为跨型号常量
Claude effortAnthropic Effort 文档Extended thinkingeffort 是行为信号而非严格预算;adaptive/manual thinking 与可用档位持续按型号演进
DeepSeek thinkingDeepSeek 当前 API 文档当前 thinking mode 会忽略 temperature/top_p 等参数,说明旧模型卡建议不能跨版本机械沿用
评测闭环OpenAI Evaluation best practicesAnthropic Evaluation tool两家当前指南都支持版本化测试与比较;OpenAI 明确要求典型、边界、对抗及生产/历史数据,并反对“凭感觉”评测
自动提示优化DSPyMIPROMIPROv2 官方文档GEPAVISTA · ACL 2026 SRWMIPROv2 可优化指令与 few-shot demonstrations(少样本示例);GEPA 的 6%/20%/35× 是论文内基线对比;VISTA(DOI 10.18653/v1/2026.acl-srw.8)的坏 seed 反例说明两者都要求独立测试与回滚
Prompt injectionOWASP LLM01:2025Anthropic 注入缓解指南NVD: CVE-2025-32711直接与间接注入都需分层缓解;EchoLeak 记录确认网络信息泄露且 UI:N,不把输入分隔或消息优先级说成安全防线