Kimi K3 于 2026 年 7 月 16 日发布。2.8 万亿参数。100 万 token 上下文。有史以来发布的最大开放权重模型。
核心功能是 K3 Swarm Max:最多 300 个子 Agent 并行运行,跨越 4,000 步进行协调,生成真实文件而非聊天回答。两个变体共享同一大脑。K3 Max 处理日常任务。K3 Swarm Max 则调动整个集群来解决问题。

大多数人打开 Kimi,输入一个问题,得到一个答案,然后关闭标签页。这大约只发挥了产品 10% 的潜力。本指南将涵盖另外 90% 的内容。

集群并非事后添加的附加功能。其编排器是一个经过并行 Agent 强化学习训练的、学习到的策略。你描述目标,集群决定如何拆分任务、生成多少个 Agent,以及如何将结果重新整合。集群在广泛、可并行化的任务上表现出色:研究 50 多个来源、批量分析、竞争监测、构建数据集。但在深度顺序任务上,即步骤 3 依赖于步骤 2 时,它们则表现不佳。

- 写规范,而不是提示词
“研究健身应用市场”——这样你会浪费积分并得到垃圾结果。一行提示词等于让集群自己决定一切。它会做出错误决定。

把集群当作承包商来对待。规范定义了要收集什么、什么算有效、允许哪些来源、确切的输出格式,以及在出现冲突时该怎么办。规范是整个工作流程中杠杆率最高的单一工件,因为在第 2 级,它将成为你可重用技能的核心。
1# 项目:[名称]2目标:[一句话,指可交付成果,而非主题]3范围:[明确包含什么,明确排除什么]4规则:[验证标准,什么算作已验证的发现]5来源:[官方帖子、论文、仅限一手来源,禁用聚合器]6输出:[文件类型 / 数量 / 命名 / 格式细节]7冲突处理:[标记该行,绝不静默解决]8停止条件:[何时停止并报告,而非猜测]
- 在投入资源前,先阅读分解计划
提交规范后,Kimi 会在运行前向你展示执行计划:有多少个子 Agent、每个负责什么、依赖顺序、步数预算。这是新手最容易跳过的一步,也是最昂贵的一步。

一个 200 个 Agent 的集群如果分解错误,代价高昂。检查计划则无需成本。你需要关注三件事:它是否理解范围,Agent 数量对于任务是否合理,以及输出计划是否与你实际需要的一致。
1在运行前,展示提议的分解方案:2- 子 Agent 数量,以及每个负责什么3- 依赖顺序(什么阻塞什么)4- 预估的步数预算5- 质量下降风险最大的地方在哪里6先不要执行。等待我的确认。
值得注意的一个细节:4,000 步是整个集群协调的总预算,而不是每个 Agent 4,000 步。一个 300 个 Agent 的运行平均每个 Agent 大约 13 步。这能告诉你任务是否符合其形态。
- 运行它
现在执行。多达 300 个子 Agent 以并行波次启动,每个都在自己的限定上下文中运行。只有结构化输出会流回协调器。
1端到端执行规范。2在计划允许的情况下,尽可能并行化。3立即标记任何阻塞点,不要静默绕过。4将所有内容合并到规范中定义的 OUTPUT 中。
你在第 1 级获得的内容
根据你的规范构建的单一集群输出。原始、未经验证,但结构清晰。大多数人止步于此。价值从第 2 级开始。

- 要求真实文件,而不是聊天回答
“一份全面的报告”给了 Agent 提前停止的许可。“一份 40 页的 PDF + 一个包含 20,000 行的 CSV + 14 张可导出的 PNG 图表”则给了它们一个质量目标。
始终在规范中首先明确输出。输出层面的具体性是研究团队与昂贵建议箱之间的区别。
1# 强输出示例:2输出:1 个 .xlsx,每个模型一行,+ 200 字简报3输出:30 个 HTML 文件,每个商店一个,按业务命名4输出:40 页 PDF + 20,000 行 CSV + 14 张 PNG 图表
- 要求真实文件,而不是聊天回答
“一份全面的报告”给了 Agent 提前停止的许可。“一份 40 页的 PDF + 一个包含 20,000 行的 CSV + 14 张可导出的 PNG 图表”则给了它们一个质量目标。始终在规范中首先明确输出。输出层面的具体性是研究团队与昂贵建议箱之间的区别。
1# 强输出示例:2输出:1 个 .xlsx,每个模型一行,+ 200 字简报3输出:30 个 HTML 文件,每个商店一个,按业务命名4输出:40 页 PDF + 20,000 行 CSV + 14 张 PNG 图表
- 使用另一个模型来验证输出
集群已知的缺陷:除非你明确要求验证,否则它会产生自信但引用不足的断言,且独立的子 Agent 有时会相互矛盾。“看起来完成了”和“是正确的”是两码事。
使用第二个模型作为验证关口。它唯一的工作是:反驳,而非称赞。你支付高级 token 不是为了生成,而是为了在下一步将工作流保存为可重用技能之前,捕获静默的错误。

1你是验证者。一个 Agent 集群产生了附件的输出。2你唯一的工作是找出哪里出错了。34检查:5- 每个声称的数据是否都能追溯到具名来源?6- 是否有任何两个部分相互矛盾?7- 是否有任何内容被当作事实呈现,但实际上是推论?8- 输出是否符合规范的格式要求?910对于每个问题:指出确切的位置和修复方法。11如果一切正常:批准。12如果任何一项失败:拒绝 + 首先指出最关键的修复。
- 将整个工作流保存为技能
经过验证的运行后,告诉 Kimi 捕获整个工作流:输入格式、Agent 步骤、输出格式、验证规则。第一次运行需要 20 分钟。之后每次运行只需 30 秒。技能是系统能够持续积累而非每次重新开始的原因。
1将整个工作流保存为可重用技能:"[名称]"2捕获:3- 输入格式(期望什么文件 / 规范形态)4- 实际有效的 Agent 步骤5- 输出格式和命名约定6- 规范中的验证规则7下次我运行此技能时,只需附加新文件,即可获得相同形态的输出。
你在第 2 级获得的内容
你可以信任的经过验证的输出,以及无需重新构建规范即可重复使用的已保存技能。这就是循环开始产生复利的地方。

- 将你自己的文档作为集群知识输入
技能捕获过程。文档到技能捕获领域知识。上传你最好的作品,Kimi 会将其结构指纹作为未来所有集群都会应用的技能来捕获。

你输入的每一个 PDF、转录稿或电子表格都成为所有 300 个 Agent 可以基于的上下文,而不是依赖训练数据。你输入得越多,输出就越像你自己的工作,而不是通用的 AI 内容。
1将此文档捕获为可重用技能。识别其成功之处:2- 结构和章节顺序3- 语气和语域4- 每个章节的分析深度5将其保存为"[名称]"。然后使用捕获的技能,在[不同主题]上生成一份新文档。6匹配其质量标准,而非内容。
- 将每次拒绝转化为永久规则
验证步骤会捕获一次错误。这个步骤确保集群永远不会再犯同样的错误。将反馈提炼为硬性规则,并将其写入一个集群在执行任何操作之前都会读取的约束文件。
1# 约束.md,自动加载2- 每个声称的数据必须追溯到一手来源,或被标记3- 禁止静默解决冲突:揭示矛盾4- [从上一次运行的验证器反馈中提炼的规则]5- [你永远不想重复的错误]6范围锁定:不要触碰规范中 SCOPE 块之外的任何内容。
- 在新输入上重放技能
这就是“复利”不再是流行语,而是体现在成果上的地方。第二次运行不是从零开始。它从你上面构建的技能、集群知识和约束文件开始。相同的工作流,新的文件,设置时间大幅减少。
重放时的经济效益显著提升。K3 的缓存命中定价降至每百万 token $0.30,比首次运行的输入价格便宜 10 倍。技能、约束和规范都属于重复上下文。只有你的新输入文件按全价计费。第一次运行是一项投资。后续每次运行都在收获回报。

输出质量也会在结构上得到改善。技能强制执行格式。约束阻止了验证器已捕获的每一个错误。集群知识使每个 Agent 都基于你实际的文档而非训练数据来进行推理。第四次运行不仅比第一次成本更低,而且能产生更好的结果,因为系统已经从三轮真实反馈中学习到了经验。

1在这些新输入上运行已保存的技能"[名称]"。2应用约束.md。使用捕获的输出格式。3[附加新文件]45将此运行的输出与上一次运行进行比较。6报告:7- 上次未出现的新发现8- 自上次运行以来发生变化的发现9- 任何消失的内容(标记为潜在差距)10- 与技能预期形态的偏差
你在第 3 级获得的内容
一个自我改进的研究流水线。每次运行都比上一次更便宜、更快、更准确,因为技能库、知识库和约束文件在不断增长。

- 将技能提升为计划 Agent
一旦循环稳定并基于技能,你就不再需要手动启动它。让 Kimi 指向一个触发器:一个计划、一个新文件投放、一个被监控的 URL。让它主动运行整个集群,只向你呈现值得关注的交付成果和偏差。

竞争监测是一个典型的例子。第一次运行:你手动构建和验证。等到它成为一个后台 Agent 时,它会每周并行检查每个竞争对手,并在零边际时间成本的情况下将简报投递到你的收件箱。整个循环中,唯一需要人类介入的,就是你设定的问题和根据答案做出的决策。
1按周计划运行技能"[名称]"。2触发器:[计划 / 新文件 / 被监控的 URL]3每次运行时:执行集群,应用约束.md,4验证,然后交付输出 + 与上次运行相比的差异。5仅当偏差超过[阈值]时才通知我。
2.8T 参数无法修复什么

幻觉随并行度放大。 更多的 Agent 搜索意味着更多自信的错误答案,除非你运行验证步骤。集群不会自我事实核查。
K3 的成本是 K2.6 的 3-4 倍。 输入:$3.00/M vs $0.95/M。输出:$15.00/M vs $4.00/M。缓存有助于重放,但首次运行成本高昂。纯粹为了成本优化,K2.6 仍然是预算选择。
开放权重尚未发布。 Moonshot 承诺在 2026 年 7 月 27 日前发布。在此之前,K3 仅通过 API 和 Kimi 应用程序运行。
集群会放大不良规范。 一个模糊的提示词通过一个 Agent 浪费一个上下文窗口。通过 300 个 Agent,它会并行浪费 300 个。
简要清单
- 避免一行提示词。 集群会自行决定一切,结果往往是错误的。
- 不要跳过分解审查。 这是最昂贵的一步。
- 必须进行验证。 “看起来完成了”不等于“是正确的”。
- 不要将未验证的输出保存为技能。 错误会在每次后续运行中复利。
- 避免在顺序任务上使用 300 个 Agent。 集群无法并行化思维链。
- K2.6 足够时,不必使用 K3。 并非所有任务都需要 2.8T 参数。
结论
大多数人会打开 Kimi,输入一个问题,然后关闭标签页。那是聊天框。它只占 K3 能力的大约 10%。
另外 90% 是一个你只需构建一次就能永久重用的研究团队。每个级别都解锁更多杠杆:首先是运行,然后是信任,接着是复利,最后是自主权。你不需要在第一天就拥有所有四个级别。从第 1 级的一个规范开始。如果输出有用,进入第 2 级进行验证。如果你计划再次运行,保存技能。系统之后会自行变得更加强大。
写规范,而不是提示词。先验证,再保存。然后看着每一次运行都比上一次更便宜、更精准。



![[备忘录] 老板正在放弃表现不佳的下属](https://youmind.club/__ym/cms-assets/media/1784827522698_408j7z_HN3Kb76awAAvvjF.jpg)

