状态传导图
橙色节点代表缺失信息;补词藻不能替代补任务条件。
观察点 01
“帮我分析一下”没有告诉模型何谓完成
模型只能猜目标、读者、证据范围和输出形式。即使答案流畅,也很难判断它是否满足真实任务。
- 模型自由度非常高
- 结果可验证性很低
模糊 Prompt 最大的问题不是短,而是缺少可验收标准。
Prompt 负责表达任务,Context 负责组装规则、证据与状态;模型只生成提案,程序硬门决定它能否成为答案或真实动作。
状态传导图
橙色节点代表缺失信息;补词藻不能替代补任务条件。
观察点 01
模型只能猜目标、读者、证据范围和输出形式。即使答案流畅,也很难判断它是否满足真实任务。
模糊 Prompt 最大的问题不是短,而是缺少可验收标准。
状态传导图
任务条件组成一个小型契约;示例用于对齐决策边界,不是越多越好。
观察点 02
把“为谁做、用哪些材料、不能做什么、输出包含哪些字段、什么算完成”写清楚。授权策略可以告诉模型何时停下,但不能替代服务端权限。
Prompt 的核心是减少无意义猜测,不是消灭所有创造性。
状态传导图
模型只能提交提案,不能给自己授权,也不能用一句“已完成”替代服务端凭证。
观察点 03
模型生成文本、JSON 或工具参数后,程序还要独立校验 schema、证据、登录身份、资源归属、确认凭证、预算和幂等键。未通过就拒绝、修复或转人工。
Prompt 是软控制;权限、类型和副作用控制必须是可执行的硬约束。
状态传导图
线上新失败要回流到回归集,形成持续改进闭环。
观察点 04
把正常、边界、对抗和历史失败样本组成回归集,记录实际模型版本、输出、轨迹和成本,再只修对应问题。否则一次改写可能解决 A、破坏 B。
生产 Prompt 是版本化程序资产,需要测试与回滚。
你现在应该能解释:生产 Prompt 是版本化程序资产,需要测试与回滚。
Prompt(提示词)负责表达目标、约束与交付格式;Context Engineering(上下文工程)负责决定本次调用还要带上哪些规则、证据、状态、历史与工具定义。模型输出仍只是概率性提案——事实校验、权限和真实副作用必须由程序控制。
同一个模型面对不同指令和上下文,输出可能不同;差多少取决于任务、模型版本、上下文材料、推理预算、采样参数和评测方式。先分清两类工程问题。
不用机械填满模板;先补齐会改变答案或验收结果的信息。下面是检查清单,不是固定咒语。
角色主要帮助设定受众、视角或语气,不会自动增加专业正确性。用 ###、"""、XML 或 JSON 分隔指令与数据有助于模型解析;但第三方网页、邮件、RAG 片段和工具结果仍是不可信数据,分隔符不会把它们变成安全指令。
| 技巧 | 怎么用 / 何时用 |
|---|---|
| Zero-shot零样本 | 直接给清晰指令、不给范例。把它作为低成本基线;是否足够要看回归集,不由任务“看起来简单”决定 |
| Few-shot少样本(给范例) | 给少量「输入→输出」范例,让模型在当前上下文中模仿标签、格式或决策边界;这是In-Context Learning(上下文学习),当前调用不会更新模型权重。示例应覆盖容易混淆的边界,否则模型也可能稳定模仿偏差 |
| CoTChain-of-Thought 思维链提示 | Kojima 2022 的零样本短语与 Wei 2022 的带推理示例在论文所测算术、符号和常识推理任务上带来提升;效果不保证跨模型、跨任务复现。当前部分推理模型的官方建议反而是保持提示直接、避免要求完整思维链;生产系统可要求可核对的依据、计算或引用 |
| 指定输出格式Output Format | 自然语言说明要 JSON、表格、分点或字数,适合人读交付;若下游代码要消费,还需 schema 和程序校验 |
| 结构化输出Structured Outputs / JSON Schema | 支持时,用 JSON Schema/function calling 约束结构比自然语言要求 JSON 更可靠。OpenAI 公布的 100% 是 gpt-4o-2024-08-06 在其复杂 schema eval 上的结构遵守率;它不保证字段值正确,且有 schema 子集、拒绝与截断等限制 |
| 分隔符 + 结构化Delimiters | 用 ###/"""/XML/JSON 区分指令、上下文和数据,帮助模型解析;它不改变来源可信度,不可信数据仍可能包含恶意指令 |
| Self-Consistency自洽性(多路径投票) | 原论文在推理题上采样多条路径并聚合答案,常优于单条贪心 CoT;它增加推理成本,而且“多数一致”仍可能多数都错 |
其他论文方法包括 Least-to-Most Prompting(从更简单子问题逐步求解)和 Step-Back Prompting(先提炼更高层概念或原则再解具体题)。它们是带特定模型、数据集与预算的实验方法,不是所有新模型都需要的固定前缀。
[42, 41, 42, 42, 43],多数票为 42(3/5)。这只说明样本间更一致;若题目或提示系统性误导,5 次都答 41 也会得到“高度一致的错误答案”。因此仍要用标准答案或可执行校验器验证。带内部推理或可调 effort 的模型,通常更适合接收目标、必要证据、硬约束、输出契约和验收标准,而不是被规定一条僵硬的思考脚本。授权策略可以告诉模型何时停止或申请确认,但真正的权限硬门仍由程序执行。参数名称和档位变化很快,必须查看具体模型版本的官方文档。
| 旋钮 | 作用 · 怎么用 |
|---|---|
| reasoning.effortOpenAI API | 控制模型愿意投入多少推理计算。截至 2026-07-14,GPT-5.6 官方指南列出 none/low/medium/high/xhigh/max,并建议从代表性任务实测档位;这只是该家族当前口径,不能复制给所有型号或厂商 |
| output_config.effortClaude API | Anthropic 将 effort 定义为影响文本、思考和工具调用总体 token 花费的行为信号,不是严格 token 预算;当前文档列出的 low/medium/high/xhigh/max 也并非每个型号都全部支持,adaptive/manual thinking 方式同样依型号变化 |
| 输出长度Output budget | 最终答案长度与内部推理投入不是一回事。可用 max_output_tokens/max_tokens 防止无限输出,再在输出契约中说明需要的详略;截断时要检测完成状态 |
| 行动预算Agent limits | 把“最多几次工具调用、哪些操作需确认、何时停止/转人工”写进协议并由程序执行。prompt 中一句“做彻底”不能替代超时、权限、幂等与审计控制 |
temperature、top_p 等参数即使传入也不会生效,因此旧模型卡的采样建议不能机械套到当前 API。
不要把“必须一步步想”或“绝不展示步骤”写成普遍规律。在同一评测集上比较:直接回答、要求简短依据、给分解示例、调整 effort。固定可用 snapshot,或记录实际模型版本;最终保留能提升可验证结果且成本可接受的方案,升级后重跑。
DSPy把语言模型流水线表示为可优化模块,MIPROv2(Multiprompt Instruction Proposal Optimizer Version 2)可联合搜索指令与 few-shot 示例;GEPA(Genetic-Pareto)读取执行轨迹、用自然语言反思并演化提示。GEPA 论文 v2 在 6 个任务设置中报告,相对其 GRPO(Group Relative Policy Optimization,组相对策略优化)基线平均高 6%、最高高 20%,最多少 35× rollout(轨迹采样)——这是论文内对比,不是所有任务的保证。
⚠️ ACL 2026 Student Research Workshop 正式论文 VISTA 在一个故意有缺陷的 GSM8K seed 上报告 GEPA 从 23.81% 降到 13.50%。这说明优化器需要开发集、独立测试集、重复运行和回滚,而不是“自动必升”。
提示词要版本管理、建评测集、做成对比较。例:20 条固定用例中,旧 prompt 对 14 条(70%),新 prompt 对 17 条(85%):是提高 15 个百分点,相对错误数从 6 降到 3(减少 50%)。样本很小,不能据此宣称线上也提升 15%;还要看错误类型、置信区间和更大留出集。OpenAI 当前评测指南也明确反对只凭“感觉能用”,并建议持续把生产与历史失败加入评测。
「帮我优化一下」——优化什么、目标是啥、给谁看?模型只能猜。
改:把目标、对象、标准说清楚。
堆一大段废话和「非常重要!!」,反而稀释了关键指令。
改:精简、结构化、要点优先。
不说要什么格式,拿到一堆没法用的自由文本。
改:明确 JSON/分点/字数/字段。
一个 prompt 塞五个任务,模型顾此失彼。
改:拆成多步/多次,或用 Agent 编排。
不同模型「脾气」不同,同一 prompt 效果不一(尤其推理模型)。
改:按目标模型调,换模型要复测。
| 问题 | 答案 |
|---|---|
| 本质是什么 | Prompt 是可测试的任务协议;Context 是本次调用的工作记忆;程序保留验证与执行控制 |
| 好 prompt 结构 | 任务 + 受众/视角 + 证据范围 + 约束 + 输出契约;示例按需加入 |
| 先改什么 | 先消除任务歧义、冲突和不可验证标准,再通过评测决定是否加示例或推理提示 |
| 核心技巧 | Few-shot 提供模式;CoT/分解提示与 Self-consistency 在部分推理任务有效,但要付出 token 并验证 |
| 推理模型特别注意 | 参数和最佳提示依具体模型版本而变;优先给目标、证据与验收标准,是否要求显式步骤用评测决定 |
| 工程化 | 版本管理 + 固定回归集 + 自动/人工评测 + 灰度/回滚;DSPy/GEPA 可生成优化候选 |
| 最大误区 | 把 prompt 当咒语、事实证明或权限系统;以及该用 RAG/微调/代码校验时仍只改措辞 |
本页于 2026-07-14 核查。提示技巧论文回答“在作者的模型与任务上发生了什么”;动态产品文档只回答“这个型号在核查日支持什么”。二者都不能代替你自己的回归评测。
| 主题 | 一手来源 | 核查结论 |
|---|---|---|
| Prompt 与 Context | OpenAI Text generation;Anthropic Context windows | 消息角色、工具结果、历史和工具定义都可能进入上下文;具体角色名与序列化依 API 而异,不能把整份 context 都叫“用户 prompt” |
| Few-shot / ICL | Brown et al., 2020 | GPT-3 论文的 few-shot 任务和示例通过文本上下文给出,没有梯度更新;不等于任何范例都会提升当前模型 |
| CoT | Wei et al., 2022;Kojima et al., 2022 | 分别支持少样本 CoT 与零样本短语在论文任务上的结果,不外推为所有模型必升 |
| 推理提示方法 | Self-Consistency;Least-to-Most;Step-Back Prompting | 这些是带模型、数据集和推理预算的实验方法,不是固定咒语 |
| Structured Outputs | OpenAI 原始发布说明;当前官方指南 | 100% 是 gpt-4o-2024-08-06 在官方复杂 schema eval 上的结构遵守率;值仍可能错,也有 schema 子集、拒绝与截断等边界 |
| OpenAI 推理模型 | Reasoning best practices;GPT-5.6 当前指南 | 官方当前建议保持提示简洁直接、避免无必要的完整 CoT 要求;GPT-5.6 当前 effort 为 none 到 max,不能外推为跨型号常量 |
| Claude effort | Anthropic Effort 文档;Extended thinking | effort 是行为信号而非严格预算;adaptive/manual thinking 与可用档位持续按型号演进 |
| DeepSeek thinking | DeepSeek 当前 API 文档 | 当前 thinking mode 会忽略 temperature/top_p 等参数,说明旧模型卡建议不能跨版本机械沿用 |
| 评测闭环 | OpenAI Evaluation best practices;Anthropic Evaluation tool | 两家当前指南都支持版本化测试与比较;OpenAI 明确要求典型、边界、对抗及生产/历史数据,并反对“凭感觉”评测 |
| 自动提示优化 | DSPy;MIPRO;MIPROv2 官方文档;GEPA;VISTA · ACL 2026 SRW | MIPROv2 可优化指令与 few-shot demonstrations(少样本示例);GEPA 的 6%/20%/35× 是论文内基线对比;VISTA(DOI 10.18653/v1/2026.acl-srw.8)的坏 seed 反例说明两者都要求独立测试与回滚 |
| Prompt injection | OWASP LLM01:2025;Anthropic 注入缓解指南;NVD: CVE-2025-32711 | 直接与间接注入都需分层缓解;EchoLeak 记录确认网络信息泄露且 UI:N,不把输入分隔或消息优先级说成安全防线 |