跳到正文
MOONSHOT FIELD NOTES · K2
模型专题 · Moonshot AI / 月之暗面

1T 混合专家 到会并行工作的视觉 Agent

Kimi K2 的故事不只是“大模型参数多”:它先用 MuonClip 稳定训练约 1T 的超稀疏 MoE(Mixture of Experts,混合专家)主干,再让模型学会陌生工具、长思考、看图看视频,最后把单 Agent 扩成能动态分工的 Agent Swarm

一句话判断

K2.6 是当前通用旗舰,K2.7 Code 是当前 Coding 旗舰。两者的官方模型卡都写约 1T 总参 / 32B 激活,公开主干拓扑与关键架构字段相同;差别主要在后训练目标、推理模式和产品使用场景。

1.04T原始 K2 报告总参数
32.6B原始 K2 每 Token 激活
384 → 8 + 1路由专家 + 共享专家
61Transformer 层
15.5TK2 Base 预训练 Token
256K0905 之后上下文
01 · 版本身份

先把“最新”分成通用与 Coding 两条线

URL 叫 Kimi K2,但这是一张家族地图。2025 年的原始 K2 是技术底座;今天真正用于新项目的主角,是通用 K2.6 和 Coding 专用 K2.7 Code。

Kimi K2 从 0711、0905、Thinking、K2.5、K2.6 演进到 K2.7 Code 的时间线,标出上下文、推理模式和当前状态
原始 K2 从文本、128K 与快速响应起步;0905 扩到 256K;Thinking 引入长思考;K2.5 接入视觉和 Swarm;K2.6 与 K2.7 Code 分别承接通用和编码路线。 查看原图 ↗
当前通用旗舰

K2.6

文本、图片、视频;对话、研究、设计、Agent、Coding;可在 Thinking 与 Instant 之间选择。

适合:需要一台多用途工作站
当前 Coding 旗舰

K2.7 Code

建立在 K2.6 上,面向长程软件工程与编码 Agent;只支持 Thinking,不能切 Instant。

适合:多文件、长回合、端到端工程任务
2025.07

K2 0711

Non-thinking128K

1.04T MoE 与 Agentic 数据底座

2025.09

K2 0905

Non-thinking256K

Coding、前端与长上下文增强

2025.11

K2 Thinking

Thinking256K

推理与工具交错,原生 INT4

2026.01

K2.5

双模式256K

原生视觉、联合 RL、Agent Swarm

2026.04

K2.6

双模式256K

当前通用旗舰,长程 Agent

2026.06

K2.7 Code

仅 Thinking256K

当前 Coding 旗舰,减少过度思考

白话理解

把这条家族想成同一辆月球车不断换任务模块:K2 是底盘,Thinking 加上长程驾驶,K2.5 装上摄像头并学会组队,K2.6 成为通用任务车,K2.7 Code 则换成软件工程专用工具箱。

02 · 完整架构

一枚 Token,怎样穿过 61 层 K2

文本直接查 Embedding;K2.5 之后的图片和视频先进入 MoonViT-3D,再经 MLP(Multi-Layer Perceptron,多层感知机)Projector 变成主干能理解的视觉 Token。61 层都用 MLA(Multi-head Latent Attention,多头潜在注意力)读历史;第 1 层是 Dense FFN(Feed-Forward Network,前馈网络),后面的 60 层才用 MoE Router 把当前 Token 送到少量专家。

文本、图片和视频进入 Kimi K2,经过 Embedding 或 MoonViT-3D 与 Projector 后,先穿过 1 个 Dense 层,再穿过 60 个带 MLA 与稀疏专家的 MoE 层,最后输出文本或工具调用
K2.5、K2.6 与 K2.7 Code 公开的主干配置相同:61 层、Hidden 7168、64 个注意力头、384 个路由专家、Top-8 和 1 个共享专家。 查看原图 ↗
01 · 变成向量

文本或视觉 Token

文字经 160K 词表 Embedding;图片和视频经 MoonViT-3D 与 MLP Projector 接入统一序列。

02 · 读取历史

64-head MLA

历史 Key / Value 先压成更小的 latent,减少长上下文 KV Cache(Key-Value Cache,键值缓存)与显存带宽压力。

03 · 选择专家

384 选 8 + 1

Router 只选 8 个 Routed Expert,同时总会经过 1 个 Shared Expert。

04 · 继续行动

文本或 Tool Call

模型输出下一 Token;Agent 框架识别工具调用、执行外部操作,再把观察结果放回上下文。

总参 / 激活1.04T / 32.6B原始 K2 报告精确口径
层数61 / 1 Dense后续主要为 MoE
Hidden7168专家中间维度 2048
Attention64 HeadsMLA 压缩历史
专家384 → Top-8另有 1 Shared
视觉MoonViT ≈ 400MK2.5 之后的官方卡片
参数口径:原始 K2 技术报告给出 1.04T 总参 / 32.6B 激活;K2.5、K2.6、K2.7 Code 模型卡统一舍入为 1T / 32B。公开 config.json 能确认三者的 61 层、384 选 8、1 个共享专家等拓扑相同,但不能据此把所有版本的参数总数都写成同一组未经再次发布的精确值。
白话理解

一枚 Token 在 61 层里都会用 MLA“找历史资料”;进入后 60 个 MoE 层时,才会再用 Router 从专家里“找 8 个专科”。注意力负责找资料,MoE 负责找处理资料的人。

03 · 超稀疏 MoE

32.6B Active,不等于一台 32B 模型

以原始 K2 报告的精确口径看,每个 Token 只算一小部分专家,所以计算量可以低很多;但完整 1.04T 权重仍要放在 GPU、CPU 或分层存储里,专家之间还要进行 All-to-All(全互连交换)通信。

Kimi K2 的 Router 从 384 个路由专家中为每个 Token 选择 8 个,并始终经过一个共享专家,再把输出加权合并
Top-8 Routed 与 1 Shared 是两条不同路径:共享专家不参加同一个 Top-k 竞争。 查看原图 ↗
模型要存1.04T

384 个路由专家都要可访问。

每 Token 计算32.6B

只激活 Top-8 路由专家和共享专家。

INT4 理论权重下限≈ 520 GB

还没算 scale、KV 和运行时。

再深一层:为什么选 sparsity 48?

K2 的路由稀疏度是 384 ÷ 8 = 48。官方缩放实验固定每 Token 激活 8 个专家,发现增加专家总数能在相同计算量下降低损失;但专家越多,路由、负载均衡和跨 GPU 通信越难。48 是能力增益与系统复杂度之间的选择。

训练使用 16-way Expert Parallelism,并将专家 Dispatch / Combine 尽量与计算重叠。MoE 不是“白拿容量”,而是用网络和调度复杂度换取稀疏计算。

04 · MLA 与长上下文

把历史压成一份更小的“索引档案”

普通多头注意力要为每个头保存越来越长的 Key / Value。MLA 先把历史压成 latent,再按各个头的视角恢复所需信息,降低 KV Cache 和 HBM(High Bandwidth Memory,高带宽显存)读写。

普通多头注意力保存每个头完整 KV,而 Kimi K2 的 MLA 保存压缩 KV latent,再为各注意力头恢复所需分量
MLA 不是让历史消失,而是换一种更紧凑的保存方式;上下文越长,KV Cache 与带宽节省越重要。 查看原图 ↗
主体预训练4K

15.5T Token 的主要序列长度。

长上下文激活60B @ 32K

退火后增加长序列训练。

原始 K2128K

通过 YaRN 扩展位置范围。

0905 之后256K

输入、输出、思考与工具历史共享。

白话理解

普通注意力像每个部门都保存一套完整档案;MLA 更像先做一份高质量压缩档案,各部门需要时再从中恢复自己的视角。它减少的是历史状态体积,不是让 256K 变成无损无限记忆。

05 · 训练稳定性

MuonClip:只给“失控的注意力头”踩刹车

Muon 的 Token 效率高,但放大训练时更容易让 QK(Query–Key,查询—键)点积失控。QK-Clip 在每次参数更新后检查各注意力头的最大 Logit,只缩放异常头对应的 Q / K 投影权重。

Kimi K2 的 MuonClip 训练循环:Muon 更新、Weight Decay、RMS Matching 后检查每个注意力头最大 Logit,超过阈值 100 时缩放该头 Q K 权重
MuonClip = Muon + Weight Decay + RMS Matching + QK-Clip。它是训练优化器,不是推理时新增的一层。 查看原图 ↗
不是 Gradient Clipping

它不裁整个模型的梯度,而是在优化器更新后缩放特定 Q / K 投影权重。

不是全头一起裁

每个 Head 单独观察;正常头保持不动,异常头才按比例缩小。

不改当前 Forward

当前 Step 的最大 Logit 只是下一次权重状态的控制信号。

15.5T
Moonshot 发布方报告

K2 Base 使用 τ = 100 的 MuonClip 完成 15.5T Token 预训练,公开逐 Step 曲线没有可观察到的 Loss Spike。这个结论属于该次大规模训练记录,不应推广成所有模型的稳定性保证。

06 · 预训练

不只喂更多 Token,还要让每个 Token 更有用

K2 同时优化数据、学习率、长上下文激活和集群流水。高质量材料不会机械重复十遍,而会分块改写、保持上下文、做忠实度检查,再进入训练。

Kimi K2 报告并列的 15.5T 主训练口径、400B 退火与 60B 长上下文阶段,以及知识和数学数据改写流程
报告总称 15.5T,并另列 400B 退火和 60B 长上下文训练,但没有说明后两段与 5.5T 的包含关系;图中保留原值而不自行求和。 查看原图 ↗
总量前段前 10T

4K 序列;500 Step Warm-up 后,学习率保持 2e-4。

报告总量后段后 5.5T

主体在 4K 上做 Cosine Decay,学习率从 2e-4 降到 2e-5;报告随后另列 400B 与 60B。

主体4K · Cosine

学习率从 2e-4 降到 2e-5。

另列末段 ①400B @ 4K

高质量数据继续 Annealing,学习率从 2e-5 降到 7e-6。

另列末段 ②60B @ 32K

继续长上下文训练,再用 YaRN 外推到 128K。

Token 账边界:技术报告把总预训练概括为 15.5T = 10T + 5.5T,又在随后段落写 400B 退火与 additional 60B 长上下文训练,但没有明确后两段是否包含在 5.5T 内。这里既不宣称“内含”,也不把三者相加成新的总量。
训练集群

H800 · 每节点 8 GPU + 2 TB RAM · 8×400 Gbps RoCE
RoCE(RDMA over Converged Ethernet,融合以太网上的远程直接内存访问)承载跨节点通信;训练采用 16-way PP(Pipeline Parallelism,流水线并行)+ 16-way EP(Expert Parallelism,专家并行)+ ZeRO-1。一个 256 GPU 模型并行组,仅 BF16 参数与 FP32 梯度缓冲就约占 6 TB GPU 显存。

07 · Agentic 数据工厂

先造工具、任务和世界,再让模型练习

Agent 能力不是“把函数说明塞进 Prompt”就自然出现。K2 先收集真实 MCP(Model Context Protocol,模型上下文协议)工具,再合成长尾工具、Agent、任务、用户、环境和成功 Rubric,最后只留下通过验证的多轮轨迹。

3000 多个真实 MCP 工具和 2 万多个合成工具进入工具仓库,再生成 Agent、任务和 Rubric,通过用户模拟器、工具模拟器或真实 Sandbox 生成轨迹,最后由 Judge 和测试过滤
模拟器负责规模,真实 Coding Sandbox 负责真实性;Rubric、测试和 Judge 共同完成大规模拒绝采样。 查看原图 ↗
3,000+真实 MCP 工具

从 GitHub 工具规范中获取真实接口。

20,000+合成长尾工具

补齐金融、机器人、制造、医疗等领域。

10,000+并发 Sandbox

软件工程环境执行真实代码与测试。

白话理解

这像给实习生建一座模拟城市:有不同公司、岗位、办事系统、用户和意外情况。模型不是背一份工具手册,而是在大量“想一步—调工具—看结果—改计划”的练习中形成行动习惯。

08 · SFT、RLVR 与 Self-Critique

会调用工具之后,还要学会“做对并及时停”

SFT(Supervised Fine-Tuning,监督微调)先建立指令与工具轨迹;RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)用测试、规则和 Sandbox 给奖励;写作、帮助性等开放任务再由 Critic 按 Rubric 比较候选答案。Budget、PTX(Pre-Training Loss,预训练辅助损失)与温度退火用于控制思考长度并缓解遗忘。

Kimi K2 的 SFT、可验证奖励、自我批评奖励和 RL 训练系统,训练引擎更新权重后通过 Checkpoint Engine 在 30 秒内同步到推理引擎
RL 能力与训练系统不可分:推理引擎负责 Rollout,训练引擎更新 Policy,Checkpoint Engine 在不同权重切分之间做高速同步。 查看原图 ↗
可验证奖励

测试、规则、答案

数学、Coding、软件工程、复杂格式和安全任务都有可自动检查的信号。

Self-Critique

Rubric 成对比较

Critic 比较同题多个答案,并通过可验证任务持续校准自己的判断标准。

预算与泛化

Budget + PTX

不同任务设不同思考预算,同时混入高质量预训练样本,减少遗忘。

< 30 s

技术报告称,一次完整 K2 权重更新可经 Checkpoint Engine 在 30 秒内完成。它优化的是 RL 训练迭代中的参数同步,不是线上模型冷启动 SLA(Service-Level Agreement,服务等级协议)。

09 · K2.5 原生多模态

视觉不是外挂:又做了一次约 15T 的联合训练

K2.5 在 K2 Base 上继续处理约 15T 混合视觉和文本 Token。图片按原生分辨率打 Patch;最多 4 个连续视频帧形成时空 Volume;图片和视频完全共享 MoonViT-3D 权重。

图片和四帧视频经过原生分辨率 Patch、NaViT Packing、MoonViT-3D、时间池化和 MLP Projector 后进入 K2 MoE 主干
视频在 Projector 前做 Patch 级时间池化,最多把 4 个连续帧组成一个时空 volume;它能压缩时间序列,但不是逐帧细节无损,也不等于固定 4 倍有效上下文。 查看原图 ↗
报告表格 · 视觉编码器

MoonViT-3D

约 1T Token

从 SigLIP-SO-400M 继续训练,再用很短的 Projector Bridge 接上 1T 主干。

报告表格 · 联合预训练

Joint Pre-training

约 15T 混合 Token

主干与视觉编码器共同训练,数据包含文本、知识、交错图文、视频和系统截图。

报告表格 · 长上下文

Long-context Mid-training

500B → 200B

序列从 32K 延伸到 256K,加入高质量长文本、长视频、推理与 Long-CoT。

Token 账存在发布方内部歧义:K2.5 报告正文先说“三阶段合计约 15T”,但同一张阶段表又分别列出 ViT 约 1T、Joint Pre-training 约 15T、Long-context Mid-training 500B → 200B。公开材料没有给出可把三者无歧义对齐的去重口径,因此这里保留各行原值,既不硬加成 16.7T,也不再断言 1T 与长上下文阶段一定包含在 15T 内。
K2.5 从联合视觉文本预训练进入只使用文本轨迹的 Zero-Vision SFT,再通过必须读取图像的 Outcome RL 和 Joint Multimodal RL 获得视觉工具能力
Zero-Vision 只描述 SFT 阶段没有额外视觉轨迹;视觉基础仍来自前面的 15T 联合预训练。 查看原图 ↗
白话理解

联合预训练已经让“图片信息”和“文字指令”住进同一套表示。随后只用高质量文本 Coding 轨迹教会模型操作 Python,这种行动方式也能迁移到图像:先看图,再用程序二值化、计数、裁切或核验。

10 · Agent Swarm / PARL

模型学的不是“多开 Agent”,而是“什么时候值得并行”

PARL(Parallel-Agent Reinforcement Learning,并行 Agent 强化学习)用一个可训练 Orchestrator 动态拆任务;Sub-agent 来自固定中间 Checkpoint,训练时冻结。最终奖励只更新 Orchestrator,降低“任务失败到底怪谁”的 Credit Assignment(信用分配)歧义。

可训练 Orchestrator 动态创建多个冻结 Sub-agent 并行使用工具,再汇总结果;PARL 奖励由任务结果、并行探索和子任务完成率构成,并用 Critical Steps 衡量关键路径
辅助奖励早期防止全串行和虚假并行,随后退火到 0;真正优化的是任务结果与关键路径,而不是 Agent 数量。 查看原图 ↗
单 Agent

一步接一步

上下文集中、易审计,但宽搜索和批量独立任务的墙钟时间线性增长。

总步数 ≈ 墙钟路径
Agent Swarm

动态拆分与汇总

独立子任务同时执行,阶段耗时由最长分支决定;拆得不均衡仍然会慢。

墙钟路径 ≈ Critical Steps
K2.5 产品预览100Sub-agents约 1,500 次协调调用
K2.6 产品系统300Sub-agents约 4,000 个协调步骤
RL 训练基础设施100K并发 Agent Tasks训练集群 Rollout,不是单任务
边界:100、300 与 100K 属于产品编排和训练基础设施的不同层级,不是模型 Checkpoint 内部有 100K 个神经网络 Agent。官方“最高 4.5×”也来自适合宽并行的特定任务。
11 · 当前模型选择

K2.6 还是 K2.7 Code?先看任务,不看版本号

K2.7 Code 更新,但它是 Coding 专项,不是全面替代 K2.6。一般写作、分析、视觉和对话仍优先从 K2.6 开始。

K2.6 与 K2.7 Code 的架构相同,但 K2.6 面向通用文本视觉 Agent 并支持 Thinking 和 Instant,K2.7 Code 面向长程 Coding 且只支持 Thinking
HighSpeed 是 K2.7 Code 的同权重高速服务,不是另一个能力更强的 Checkpoint。 查看原图 ↗
交互 · 选任务

你准备让模型做什么?

推荐起点 K2.6 Thinking

通用分析既需要推理,也可能调用搜索或代码工具;先用 K2.6 Thinking,再用真实成本决定是否切 Instant。

支持文本、图片、视频;256K。
K2.6

Thinking 默认开启、可关闭;API 固定 temperature:Thinking 1.0 / Instant 0.6,top_p 0.95,其他值会报错。

K2.7 Code

强制 Thinking;API 固定 temperature 1.0、top_p 0.95,关闭会报错。

约 -30%

官方称 K2.7 Code 平均少约 30% Thinking Token,但没有公开完整任务分布。

12 · 评测证据

Benchmark 测的是“模型 + 预算 + 工具 + Harness”

Harness(评测脚手架)包括 Prompt、工具、Agent 循环、上下文管理和终止规则;同一权重换一套 Harness,分数就可能明显变化。这里不做一面“谁第一”的数字墙,而是教你读清测试条件。

Kimi K2 评测证据阶梯,从裸模型回答、长思考、工具、Agent Harness、多次运行到产品系统,并展示官方与独立评测的差异
越往右,越接近完整 Agent 系统,也越不能把结果只归因于模型权重。 查看原图 ↗
官方最新 Coding Harness

K2.7 Code 相对 K2.6

Kimi Code Bench v2
62.0vs 50.9
Program Bench
53.6vs 48.3
MCP Atlas
76.0vs 69.4
MCP Mark Verified
81.1vs 72.8

K2.7 / K2.6 使用 Kimi Code CLI + Thinking、temperature 1.0、top-p 0.95 与 262,144 Token 上下文。Kimi Code Bench v2 属 Moonshot 内部题集;MCP Atlas 与 MCP Mark Verified 各为 3 次运行均值。

独立 Harness 信号
56.2

NIST CAISI 的 K2 Thinking SWE-bench Verified;Moonshot 自报 Harness 为 71.3(5 次运行均值)。两者设置不同,差值不能归因于权重。

54

Artificial Analysis 在 2026-04-20 发布文章时给 K2.6 的 Intelligence Index;这是当日快照,不是永久排名。

160M

AA 跑完整 Index 约使用的 Reasoning Token;能力强,但推理预算也高。

比较前先对齐
  • 精确模型与 Provider
  • Thinking / Instant
  • 最大生成与重试
  • 工具、Prompt 与权限
  • 上下文压缩策略
  • 单次、平均或 Best-of-N
13 · API 与成本

当前 ID、价格和 Thinking 预算

API(Application Programming Interface,应用编程接口)中的原 K2 0711、0905、Turbo 与 Thinking 型号已于 2026-05-25 停止维护与支持。新项目使用 K2.6、K2.7 Code,或为了成本继续评估 K2.5。

模型缓存命中未命中输入输出模式
kimi-k2.5$0.10$0.60$3.00双模式
kimi-k2.6$0.16$0.95$4.00双模式
kimi-k2.7-code$0.19$0.95$4.00Thinking
kimi-k2.7-code-highspeed$0.38$1.90$8.00同权重高速

美元 / 100 万 Token,未含税,核查于 2026-07-14;四个型号的上下文均为 262,144 Token。Thinking Token 与最终答案按输出计费。

交互 · 请求成本估算

一个 Agent 任务大约多少钱?

估算总成本 $0.1518
单 Agent
$0.1518
输入成本
$0.0318
输出成本
$0.1200
只估模型 Token。真实任务还包含重试、工具、搜索、Sandbox、失败轨迹和上下文压缩。
14 · 开放权重与生产部署

INT4 把 1T 变小,但没有变成消费级单卡

按原始 K2 的 1.04T 参数做理想化换算,BF16(Brain Floating Point 16,16 位脑浮点)权重约 2.08 TB,INT4(4-bit Integer,4 位整数)理论下限仍约 520 GB。K2.5 / K2.6 / K2.7 Code 的官方 Hugging Face 原生 INT4 仓库实际约 595 GB,还要额外留出 KV Cache、路由与运行时缓冲。

Kimi K2 生产系统包括 Gateway、任务路由、K2.6 或 K2.7 Code、Agent Orchestrator、权限策略、Sandbox、搜索、文件和业务工具、测试与人工确认、日志与成本监控
模型只负责提出行动;权限策略、工具执行、测试、审批、预算与审计仍在模型外部。 查看原图 ↗
原始 K2 · FP8

16× H200 / H20 示例

官方 128K 指南把 16 GPU 作为主流平台最小部署单元,可用 TP16 或 DP + EP。

K2.6 / K2.7 · INT4

8× H200 · TP8 示例

官方提供 vLLM 0.19.1 与 SGLang 0.5.10+ 单节点示例;不是任意并发下的理论下限。

CPU + GPU

KTransformers

可把部分专家放到 CPU,但需要服务器级内存,Decode 与尾延迟取决于带宽和专家热点。

理论权重下限
BF16 / FP16≈ 2.08 TB
FP8≈ 1.04 TB
INT4≈ 520 GB

前三项是用 1.04T × 每参数位宽得到的十进制理论值,未包含元数据与运行时开销;截至 2026-07-14,K2.7 Code 官方仓库实占约 595.2 GB。32.6B Active 只描述原始 K2 每 Token 的计算路径。

上线前

别只测“能不能回答”

  1. 精度:固定业务题、长上下文、Tool JSON 与 Provider 一致性
  2. 性能:Prefill、Decode、P95、并发、EP All-to-All 与 Cache
  3. Agent:预算、终止、重试、工具错误、父子任务取消
  4. 安全:最小权限、Prompt Injection、审批与可逆操作
  5. 成本:Reasoning Token、失败轨迹、Swarm 重复工作
  6. 许可:Modified MIT 规定:商业产品若月活超过 1 亿,或月收入超过 2,000 万美元(或等值货币),须在用户界面显著展示“Kimi K2”
15 · 适用边界

什么时候适合 K2,什么时候先别上 300 个 Agent

K2 的优势是大容量、长思考、视觉与工具组合;代价是权重规模、Thinking Token、长任务时间和多 Agent 的系统复杂度。

适合

复杂、可验证、能拆分

  • 多文件仓库修改与长程 Coding
  • 图像 / 视频辅助的视觉调试
  • 需要搜索和代码工具的深度研究
  • 100 个独立实体的宽搜索或批处理
  • 数据不出域且有集群运维能力
谨慎

简单、强实时、高副作用

  • 毫秒级补全或非常简单的问答
  • 一步严格依赖上一步的串行任务
  • 多个 Agent 会同时修改同一状态
  • 工具昂贵、不可逆或权限过高
  • 只有单张消费级显卡的本地部署
独立安全研究 · 初步信号

一项 2026 年 K2.5 研究报告了较强双用途能力、较少 CBRNE(Chemical, Biological, Radiological, Nuclear and Explosives,化学/生物/放射/核与爆炸物)拒绝、有限测试中的 Sabotage / Self-replication 倾向,以及中文政治偏见;同时未观察到前沿级自主网络攻击或长期恶意目标,并发现其通常拒绝强化用户妄想。这是一项 Preliminary Assessment(初步评估),适合推动红队与权限隔离,不是对整个家族的最终定论。

训练未知

K2.6 / K2.7 Code 没有独立技术报告,新增 Token、数据配比和完整 RL 配方未公开。

Swarm 未知

300 Agent、4,000 步和 5 天案例是产品能力与案例,不是公开成功率。

评测未知

Kimi Code Bench v2、Claw 24/7 为内部题集,外部难以完整复现。

效率未知

K2.7 少约 30% Thinking Token 没有公开完整任务分布和置信区间。

最终判断

Kimi K2 的核心创新是一条连续系统链:用超稀疏 MoE 承载 1T 容量,用 MLA 控制长上下文状态,用 MuonClip 稳定超大训练,用 Agentic 数据与 RL 学会行动,再用视觉联合训练和 PARL 把单 Agent 扩成并行协作。理解这条链,比背一张榜单更重要。

16 · 来源与方法

模型、产品、评测,分三层核查

参数与架构以技术报告和机器配置为准;当前型号、价格与限制以 API 文档为准;能力结论同时保留官方 Harness 和独立评测。

01
Kimi K2 技术报告

架构、MuonClip、15.5T、Agentic 数据与 RL

02
Kimi K2 官方仓库

权重、配置、许可与部署指南

03
K2-Instruct-0905

256K、Coding 更新与 Harness

04
K2 Thinking

Thinking、原生 INT4 与工具调用

05
K2.5 技术报告

MoonViT-3D、联合训练、视觉 RL 与 PARL

06
K2.5 模型卡

精确配置、评测与部署

07
K2.5 官方博客

产品能力、100 Agent 与案例

08
K2.6 模型卡

当前通用模型、配置、评测与部署

09
K2.6 官方博客

长程 Coding、Swarm 与主动 Agent

10
K2.7 Code 模型卡

Coding 专项、配置、评测与权重

11
K2.7 Code 官方介绍

定位、思考效率与选型

12
Kimi Code 发布记录

2026-06-12 正式发布日期

13
Kimi API 模型列表

当前 ID 与旧 K2 API 停止维护状态

14
K2.7 API 指南

强制 Thinking、多模态与参数

15
K2.7 API 价格

标准版与 HighSpeed 单价

16
K2.6 API 价格

缓存命中、输入与输出单价

17
Checkpoint Engine

RL 权重更新系统

18
Modified MIT License

开放权重的商业品牌条款

19
NIST CAISI

K2 Thinking 独立软件与安全评测

20
Artificial Analysis

统一 Harness 下的 K2.6 外部信号

21
K2.5 独立安全研究

初步安全风险与能力边界

22
K2.5 API 价格

缓存命中、输入与输出单价

23
K2.6 部署指南

vLLM、SGLang 与 H200 验证配置

24
K2.7 Code 权重文件

原生 INT4 分片与仓库实占

25
K2.6 API 指南

Thinking / Instant 的固定采样参数

研究底稿:architecture/Kimi/Kimi-K2深度研究.md。本页于 2026-07-14 重新核对原始技术报告、官方 config.json / 权重文件、API 与部署文档;价格、模型 ID、框架版本、榜单和服务速度仍会变化,生产使用前请再次打开官方文档。