从 1T 混合专家 到会并行工作的视觉 Agent
Kimi K2 的故事不只是“大模型参数多”:它先用 MuonClip 稳定训练约 1T 的超稀疏 MoE(Mixture of Experts,混合专家)主干,再让模型学会陌生工具、长思考、看图看视频,最后把单 Agent 扩成能动态分工的 Agent Swarm。
K2.6 是当前通用旗舰,K2.7 Code 是当前 Coding 旗舰。两者的官方模型卡都写约 1T 总参 / 32B 激活,公开主干拓扑与关键架构字段相同;差别主要在后训练目标、推理模式和产品使用场景。
一套主干,两条当前产品路线
先把“最新”分成通用与 Coding 两条线
URL 叫 Kimi K2,但这是一张家族地图。2025 年的原始 K2 是技术底座;今天真正用于新项目的主角,是通用 K2.6 和 Coding 专用 K2.7 Code。
K2.6
文本、图片、视频;对话、研究、设计、Agent、Coding;可在 Thinking 与 Instant 之间选择。
适合:需要一台多用途工作站K2.7 Code
建立在 K2.6 上,面向长程软件工程与编码 Agent;只支持 Thinking,不能切 Instant。
适合:多文件、长回合、端到端工程任务K2 0711
1.04T MoE 与 Agentic 数据底座
K2 0905
Coding、前端与长上下文增强
K2 Thinking
推理与工具交错,原生 INT4
K2.5
原生视觉、联合 RL、Agent Swarm
K2.6
当前通用旗舰,长程 Agent
K2.7 Code
当前 Coding 旗舰,减少过度思考
把这条家族想成同一辆月球车不断换任务模块:K2 是底盘,Thinking 加上长程驾驶,K2.5 装上摄像头并学会组队,K2.6 成为通用任务车,K2.7 Code 则换成软件工程专用工具箱。
一枚 Token,怎样穿过 61 层 K2
文本直接查 Embedding;K2.5 之后的图片和视频先进入 MoonViT-3D,再经 MLP(Multi-Layer Perceptron,多层感知机)Projector 变成主干能理解的视觉 Token。61 层都用 MLA(Multi-head Latent Attention,多头潜在注意力)读历史;第 1 层是 Dense FFN(Feed-Forward Network,前馈网络),后面的 60 层才用 MoE Router 把当前 Token 送到少量专家。
文本或视觉 Token
文字经 160K 词表 Embedding;图片和视频经 MoonViT-3D 与 MLP Projector 接入统一序列。
64-head MLA
历史 Key / Value 先压成更小的 latent,减少长上下文 KV Cache(Key-Value Cache,键值缓存)与显存带宽压力。
384 选 8 + 1
Router 只选 8 个 Routed Expert,同时总会经过 1 个 Shared Expert。
文本或 Tool Call
模型输出下一 Token;Agent 框架识别工具调用、执行外部操作,再把观察结果放回上下文。
config.json 能确认三者的 61 层、384 选 8、1 个共享专家等拓扑相同,但不能据此把所有版本的参数总数都写成同一组未经再次发布的精确值。一枚 Token 在 61 层里都会用 MLA“找历史资料”;进入后 60 个 MoE 层时,才会再用 Router 从专家里“找 8 个专科”。注意力负责找资料,MoE 负责找处理资料的人。
32.6B Active,不等于一台 32B 模型
以原始 K2 报告的精确口径看,每个 Token 只算一小部分专家,所以计算量可以低很多;但完整 1.04T 权重仍要放在 GPU、CPU 或分层存储里,专家之间还要进行 All-to-All(全互连交换)通信。
384 个路由专家都要可访问。
只激活 Top-8 路由专家和共享专家。
还没算 scale、KV 和运行时。
再深一层:为什么选 sparsity 48?
K2 的路由稀疏度是 384 ÷ 8 = 48。官方缩放实验固定每 Token 激活 8 个专家,发现增加专家总数能在相同计算量下降低损失;但专家越多,路由、负载均衡和跨 GPU 通信越难。48 是能力增益与系统复杂度之间的选择。
训练使用 16-way Expert Parallelism,并将专家 Dispatch / Combine 尽量与计算重叠。MoE 不是“白拿容量”,而是用网络和调度复杂度换取稀疏计算。
把历史压成一份更小的“索引档案”
普通多头注意力要为每个头保存越来越长的 Key / Value。MLA 先把历史压成 latent,再按各个头的视角恢复所需信息,降低 KV Cache 和 HBM(High Bandwidth Memory,高带宽显存)读写。
15.5T Token 的主要序列长度。
退火后增加长序列训练。
通过 YaRN 扩展位置范围。
输入、输出、思考与工具历史共享。
普通注意力像每个部门都保存一套完整档案;MLA 更像先做一份高质量压缩档案,各部门需要时再从中恢复自己的视角。它减少的是历史状态体积,不是让 256K 变成无损无限记忆。
MuonClip:只给“失控的注意力头”踩刹车
Muon 的 Token 效率高,但放大训练时更容易让 QK(Query–Key,查询—键)点积失控。QK-Clip 在每次参数更新后检查各注意力头的最大 Logit,只缩放异常头对应的 Q / K 投影权重。
它不裁整个模型的梯度,而是在优化器更新后缩放特定 Q / K 投影权重。
每个 Head 单独观察;正常头保持不动,异常头才按比例缩小。
当前 Step 的最大 Logit 只是下一次权重状态的控制信号。
K2 Base 使用 τ = 100 的 MuonClip 完成 15.5T Token 预训练,公开逐 Step 曲线没有可观察到的 Loss Spike。这个结论属于该次大规模训练记录,不应推广成所有模型的稳定性保证。
不只喂更多 Token,还要让每个 Token 更有用
K2 同时优化数据、学习率、长上下文激活和集群流水。高质量材料不会机械重复十遍,而会分块改写、保持上下文、做忠实度检查,再进入训练。
4K 序列;500 Step Warm-up 后,学习率保持 2e-4。
主体在 4K 上做 Cosine Decay,学习率从 2e-4 降到 2e-5;报告随后另列 400B 与 60B。
学习率从 2e-4 降到 2e-5。
高质量数据继续 Annealing,学习率从 2e-5 降到 7e-6。
继续长上下文训练,再用 YaRN 外推到 128K。
H800 · 每节点 8 GPU + 2 TB RAM · 8×400 Gbps RoCE
RoCE(RDMA over Converged Ethernet,融合以太网上的远程直接内存访问)承载跨节点通信;训练采用 16-way PP(Pipeline Parallelism,流水线并行)+ 16-way EP(Expert Parallelism,专家并行)+ ZeRO-1。一个 256 GPU 模型并行组,仅 BF16 参数与 FP32 梯度缓冲就约占 6 TB GPU 显存。
先造工具、任务和世界,再让模型练习
Agent 能力不是“把函数说明塞进 Prompt”就自然出现。K2 先收集真实 MCP(Model Context Protocol,模型上下文协议)工具,再合成长尾工具、Agent、任务、用户、环境和成功 Rubric,最后只留下通过验证的多轮轨迹。
从 GitHub 工具规范中获取真实接口。
补齐金融、机器人、制造、医疗等领域。
软件工程环境执行真实代码与测试。
这像给实习生建一座模拟城市:有不同公司、岗位、办事系统、用户和意外情况。模型不是背一份工具手册,而是在大量“想一步—调工具—看结果—改计划”的练习中形成行动习惯。
会调用工具之后,还要学会“做对并及时停”
SFT(Supervised Fine-Tuning,监督微调)先建立指令与工具轨迹;RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)用测试、规则和 Sandbox 给奖励;写作、帮助性等开放任务再由 Critic 按 Rubric 比较候选答案。Budget、PTX(Pre-Training Loss,预训练辅助损失)与温度退火用于控制思考长度并缓解遗忘。
测试、规则、答案
数学、Coding、软件工程、复杂格式和安全任务都有可自动检查的信号。
Rubric 成对比较
Critic 比较同题多个答案,并通过可验证任务持续校准自己的判断标准。
Budget + PTX
不同任务设不同思考预算,同时混入高质量预训练样本,减少遗忘。
技术报告称,一次完整 K2 权重更新可经 Checkpoint Engine 在 30 秒内完成。它优化的是 RL 训练迭代中的参数同步,不是线上模型冷启动 SLA(Service-Level Agreement,服务等级协议)。
视觉不是外挂:又做了一次约 15T 的联合训练
K2.5 在 K2 Base 上继续处理约 15T 混合视觉和文本 Token。图片按原生分辨率打 Patch;最多 4 个连续视频帧形成时空 Volume;图片和视频完全共享 MoonViT-3D 权重。
MoonViT-3D
约 1T Token从 SigLIP-SO-400M 继续训练,再用很短的 Projector Bridge 接上 1T 主干。
Joint Pre-training
约 15T 混合 Token主干与视觉编码器共同训练,数据包含文本、知识、交错图文、视频和系统截图。
Long-context Mid-training
500B → 200B序列从 32K 延伸到 256K,加入高质量长文本、长视频、推理与 Long-CoT。
联合预训练已经让“图片信息”和“文字指令”住进同一套表示。随后只用高质量文本 Coding 轨迹教会模型操作 Python,这种行动方式也能迁移到图像:先看图,再用程序二值化、计数、裁切或核验。
模型学的不是“多开 Agent”,而是“什么时候值得并行”
PARL(Parallel-Agent Reinforcement Learning,并行 Agent 强化学习)用一个可训练 Orchestrator 动态拆任务;Sub-agent 来自固定中间 Checkpoint,训练时冻结。最终奖励只更新 Orchestrator,降低“任务失败到底怪谁”的 Credit Assignment(信用分配)歧义。
一步接一步
上下文集中、易审计,但宽搜索和批量独立任务的墙钟时间线性增长。
总步数 ≈ 墙钟路径动态拆分与汇总
独立子任务同时执行,阶段耗时由最长分支决定;拆得不均衡仍然会慢。
墙钟路径 ≈ Critical StepsK2.6 还是 K2.7 Code?先看任务,不看版本号
K2.7 Code 更新,但它是 Coding 专项,不是全面替代 K2.6。一般写作、分析、视觉和对话仍优先从 K2.6 开始。
你准备让模型做什么?
通用分析既需要推理,也可能调用搜索或代码工具;先用 K2.6 Thinking,再用真实成本决定是否切 Instant。
支持文本、图片、视频;256K。Thinking 默认开启、可关闭;API 固定 temperature:Thinking 1.0 / Instant 0.6,top_p 0.95,其他值会报错。
强制 Thinking;API 固定 temperature 1.0、top_p 0.95,关闭会报错。
官方称 K2.7 Code 平均少约 30% Thinking Token,但没有公开完整任务分布。
Benchmark 测的是“模型 + 预算 + 工具 + Harness”
Harness(评测脚手架)包括 Prompt、工具、Agent 循环、上下文管理和终止规则;同一权重换一套 Harness,分数就可能明显变化。这里不做一面“谁第一”的数字墙,而是教你读清测试条件。
K2.7 Code 相对 K2.6
- Kimi Code Bench v2
- 62.0vs 50.9
- Program Bench
- 53.6vs 48.3
- MCP Atlas
- 76.0vs 69.4
- MCP Mark Verified
- 81.1vs 72.8
K2.7 / K2.6 使用 Kimi Code CLI + Thinking、temperature 1.0、top-p 0.95 与 262,144 Token 上下文。Kimi Code Bench v2 属 Moonshot 内部题集;MCP Atlas 与 MCP Mark Verified 各为 3 次运行均值。
NIST CAISI 的 K2 Thinking SWE-bench Verified;Moonshot 自报 Harness 为 71.3(5 次运行均值)。两者设置不同,差值不能归因于权重。
Artificial Analysis 在 2026-04-20 发布文章时给 K2.6 的 Intelligence Index;这是当日快照,不是永久排名。
AA 跑完整 Index 约使用的 Reasoning Token;能力强,但推理预算也高。
- 精确模型与 Provider
- Thinking / Instant
- 最大生成与重试
- 工具、Prompt 与权限
- 上下文压缩策略
- 单次、平均或 Best-of-N
当前 ID、价格和 Thinking 预算
API(Application Programming Interface,应用编程接口)中的原 K2 0711、0905、Turbo 与 Thinking 型号已于 2026-05-25 停止维护与支持。新项目使用 K2.6、K2.7 Code,或为了成本继续评估 K2.5。
| 模型 | 缓存命中 | 未命中输入 | 输出 | 模式 |
|---|---|---|---|---|
| kimi-k2.5 | $0.10 | $0.60 | $3.00 | 双模式 |
| kimi-k2.6 | $0.16 | $0.95 | $4.00 | 双模式 |
| kimi-k2.7-code | $0.19 | $0.95 | $4.00 | Thinking |
| kimi-k2.7-code-highspeed | $0.38 | $1.90 | $8.00 | 同权重高速 |
美元 / 100 万 Token,未含税,核查于 2026-07-14;四个型号的上下文均为 262,144 Token。Thinking Token 与最终答案按输出计费。
一个 Agent 任务大约多少钱?
- 单 Agent
- $0.1518
- 输入成本
- $0.0318
- 输出成本
- $0.1200
INT4 把 1T 变小,但没有变成消费级单卡
按原始 K2 的 1.04T 参数做理想化换算,BF16(Brain Floating Point 16,16 位脑浮点)权重约 2.08 TB,INT4(4-bit Integer,4 位整数)理论下限仍约 520 GB。K2.5 / K2.6 / K2.7 Code 的官方 Hugging Face 原生 INT4 仓库实际约 595 GB,还要额外留出 KV Cache、路由与运行时缓冲。
16× H200 / H20 示例
官方 128K 指南把 16 GPU 作为主流平台最小部署单元,可用 TP16 或 DP + EP。
8× H200 · TP8 示例
官方提供 vLLM 0.19.1 与 SGLang 0.5.10+ 单节点示例;不是任意并发下的理论下限。
KTransformers
可把部分专家放到 CPU,但需要服务器级内存,Decode 与尾延迟取决于带宽和专家热点。
前三项是用 1.04T × 每参数位宽得到的十进制理论值,未包含元数据与运行时开销;截至 2026-07-14,K2.7 Code 官方仓库实占约 595.2 GB。32.6B Active 只描述原始 K2 每 Token 的计算路径。
别只测“能不能回答”
- 精度:固定业务题、长上下文、Tool JSON 与 Provider 一致性
- 性能:Prefill、Decode、P95、并发、EP All-to-All 与 Cache
- Agent:预算、终止、重试、工具错误、父子任务取消
- 安全:最小权限、Prompt Injection、审批与可逆操作
- 成本:Reasoning Token、失败轨迹、Swarm 重复工作
- 许可:Modified MIT 规定:商业产品若月活超过 1 亿,或月收入超过 2,000 万美元(或等值货币),须在用户界面显著展示“Kimi K2”
什么时候适合 K2,什么时候先别上 300 个 Agent
K2 的优势是大容量、长思考、视觉与工具组合;代价是权重规模、Thinking Token、长任务时间和多 Agent 的系统复杂度。
复杂、可验证、能拆分
- 多文件仓库修改与长程 Coding
- 图像 / 视频辅助的视觉调试
- 需要搜索和代码工具的深度研究
- 100 个独立实体的宽搜索或批处理
- 数据不出域且有集群运维能力
简单、强实时、高副作用
- 毫秒级补全或非常简单的问答
- 一步严格依赖上一步的串行任务
- 多个 Agent 会同时修改同一状态
- 工具昂贵、不可逆或权限过高
- 只有单张消费级显卡的本地部署
一项 2026 年 K2.5 研究报告了较强双用途能力、较少 CBRNE(Chemical, Biological, Radiological, Nuclear and Explosives,化学/生物/放射/核与爆炸物)拒绝、有限测试中的 Sabotage / Self-replication 倾向,以及中文政治偏见;同时未观察到前沿级自主网络攻击或长期恶意目标,并发现其通常拒绝强化用户妄想。这是一项 Preliminary Assessment(初步评估),适合推动红队与权限隔离,不是对整个家族的最终定论。
K2.6 / K2.7 Code 没有独立技术报告,新增 Token、数据配比和完整 RL 配方未公开。
300 Agent、4,000 步和 5 天案例是产品能力与案例,不是公开成功率。
Kimi Code Bench v2、Claw 24/7 为内部题集,外部难以完整复现。
K2.7 少约 30% Thinking Token 没有公开完整任务分布和置信区间。
Kimi K2 的核心创新是一条连续系统链:用超稀疏 MoE 承载 1T 容量,用 MLA 控制长上下文状态,用 MuonClip 稳定超大训练,用 Agentic 数据与 RL 学会行动,再用视觉联合训练和 PARL 把单 Agent 扩成并行协作。理解这条链,比背一张榜单更重要。
模型、产品、评测,分三层核查
参数与架构以技术报告和机器配置为准;当前型号、价格与限制以 API 文档为准;能力结论同时保留官方 Harness 和独立评测。
架构、MuonClip、15.5T、Agentic 数据与 RL
权重、配置、许可与部署指南
256K、Coding 更新与 Harness
Thinking、原生 INT4 与工具调用
MoonViT-3D、联合训练、视觉 RL 与 PARL
精确配置、评测与部署
产品能力、100 Agent 与案例
当前通用模型、配置、评测与部署
长程 Coding、Swarm 与主动 Agent
Coding 专项、配置、评测与权重
定位、思考效率与选型
2026-06-12 正式发布日期
当前 ID 与旧 K2 API 停止维护状态
强制 Thinking、多模态与参数
标准版与 HighSpeed 单价
缓存命中、输入与输出单价
RL 权重更新系统
开放权重的商业品牌条款
K2 Thinking 独立软件与安全评测
统一 Harness 下的 K2.6 外部信号
初步安全风险与能力边界
缓存命中、输入与输出单价
vLLM、SGLang 与 H200 验证配置
原生 INT4 分片与仓库实占
Thinking / Instant 的固定采样参数
研究底稿:architecture/Kimi/Kimi-K2深度研究.md。本页于 2026-07-14 重新核对原始技术报告、官方 config.json / 权重文件、API 与部署文档;价格、模型 ID、框架版本、榜单和服务速度仍会变化,生产使用前请再次打开官方文档。