Kimi K3 终结了 AI 订阅时代

@0xDominiqq
英语3天前 · 2026年7月18日
275K
83
12
4
176

TL;DR

Moonshot AI 的 Kimi K3 引入了拥有 2.8 万亿参数的开放权重模型,具备百万级 token 上下文窗口。它利用混合专家模型(MoE)和创新的注意力机制,大幅降低了成本,并向封闭 API 的主导地位发起了挑战。

头条数字并非故事的全部

7 月 27 日,Moonshot AI 以修改版 MIT 许可发布了 Kimi K3 的完整权重。规格表看起来像在炫耀:2.8 万亿参数、百万级上下文窗口,以及有史以来最大开源权重模型的称号,比 DeepSeek V4 Pro 大约大 75%。

但规模只是个诱饵。真正的故事是,谁控制了访问前沿智能的权限,正在发生转变。三年来,最好的模型都躲在 API 后面。你付租金,房东定条款,如果供应商重新定价端点或悄悄改变模型行为,你的产品就得承受损失。

开源权重打破了这种安排。一旦文件公开,任何实验室都无法收回这项能力。这一事实改变了所有人的经济账,包括那些永远不会下载一个分片的人。

规格表一览

规格

数值

参数

2.8 万亿

专家数

896 个总专家,每个 token 激活 16 个

上下文窗口

1,048,576 个 token

许可

修改版 MIT

权重发布

7 月 27 日

比 DeepSeek V4 Pro 大

~75%

相比 K2 的扩展效率

~2.5 倍

定价

费率

输入(缓存命中)

$0.30 / 1M tokens

输入(缓存未命中)

$3.00 / 1M tokens

输出

$15.00 / 1M tokens

2.8T 模型如何避免 2.8T 的成本

一个相同规模的密集模型将无法使用。对每个 token 运行所有参数是所有万亿级模型面临的瓶颈:太慢、太贵,无法绕过物理限制。

K3 通过激进的混合专家设计绕过了这一问题。模型内部有 896 个专家子网络。对于任何一个 token,只有 16 个被激活。你获得 2.8 万亿参数存储的知识,同时只支付远小于该规模的推理成本。

这就是稀疏性,而 K3 比任何之前的开源模型都更依赖它。K2 证明了这种方法有效。K3 则将其变成了核心赌注。

Dominique - inline image

两篇承担重任的研究论文

两项架构变化使其他一切成为可能,而且这两项研究都在模型发布前作为开放研究发表,这为 Moonshot AI 在基准测试出现之前就赢得了研究人员的信任。

第一个是 Kimi Delta Attention,一种混合线性注意力机制。标准注意力的成本随上下文变长而呈二次方增长,这就是为什么百万级窗口通常只停留在营销材料中。KDA 的扩展方式不同,而这种差异是 1M 窗口能以任何人实际支付得起的价格存在的唯一原因。

第二个是注意力残差,用来替代标准残差连接。Moonshot AI 认为它带来了持续的扩展收益,使他们能够构建更深的模型而不会出现通常的性能退化。根据他们自己的数据,这种组合的扩展效率大约是 K2 的 2.5 倍。

百万级 token 消灭了什么

Dominique - inline image

目前生产环境中的大部分检索基础架构都是一种变通方案。分块、嵌入、向量数据库、RAG 管道:所有这些都是为了弥补模型一次无法在工作记忆中容纳足够多的内容。

百万级 token 改变了默认状态。整个代码库放入一个提示。一年的内部文档。五十个视频转录。所有内容同时在注意力层中,模型在整篇语料库上进行推理,而不是拼接检索到的片段并希望接缝处能保持。

原生视觉进一步拓宽了输入面。截图、白板照片、架构图和图表可以与周围的代码和文本在同一个上下文中读取。K3 在基准测试中最强的表现出现在前端编码上,这绝非偶然:模型在一个上下文窗口内看到设计并写出实现。

比基准测试更重要的定价表

列出的费率:缓存命中时每百万输入 token $0.30,缓存未命中时 $3.00,每百万输出 token $15.00,上下文为 1,048,576 个 token。

缓存数字是值得细看的。Moonshot 报告在长时间编码会话中缓存命中率超过 90%。想想 Agent 实际做了什么:它一遍又一遍地重读同一个代码仓库,持续数小时。没有缓存,每次传递都要支付全价输入费用。有了缓存,长时间会话的成本大约降低 4 倍。

长周期 Agent 的成败完全取决于这种计算。K3 是为需要最低限度监督、持续运行数小时的会话而构建的,它能导航仓库、编排终端工具、检查自己的工作。定价结构就是产品本身。

没人能忽视的陷阱

K3 没有经济模式。推理始终开启且固定在最高水平。独立测试者看到它在一个微不足道的 SVG 请求上烧掉了超过 13,000 个思考 token,对于一个一次性查询来说大约 $0.25。

教训在于路由。快速、廉价、高并发的调用应该交给较小的模型。K3 只有在上下文规模和任务复杂度足以证明始终开启推理的合理性时,才值得其成本。把它当作通用聊天端点使用就是在烧钱。

五分钟接入

API 与 OpenAI 兼容。更换 base_url 和密钥,保留现有代码:

text
1from openai import OpenAI
2import os
3
4client = OpenAI(
5 api_key=os.environ["MOONSHOT_API_KEY"],
6 base_url="https://api.moonshot.ai/v1",
7)
8
9completion = client.chat.completions.create(
10 model="kimi-k3",
11 messages=[{"role": "user", "content": "用一句话介绍 Kimi K3。"}],
12)
13print(completion.choices[0].message.content)

推理通过一个顶层字段配置,目前仅接受 "max":

text
1completion = client.chat.completions.create(
2 model="kimi-k3",
3 reasoning_effort="max",
4 messages=[{"role": "user", "content": "证明根号 2 是无理数。"}],
5)
6print(completion.choices[0].message.content)

流式传输以标准方式工作,推理内容通过单独的 delta 字段传递,这样你可以独立渲染思考过程和答案:

text
1stream = client.chat.completions.create(
2 model="kimi-k3",
3 messages=[{"role": "user", "content": "解释为什么天空是蓝色的。"}],
4 stream=True,
5)
6
7for chunk in stream:
8 delta = chunk.choices[0].delta
9 reasoning = getattr(delta, "reasoning_content", None)
10 if reasoning:
11 print(reasoning, end="", flush=True)
12 if delta.content:
13 print(delta.content, end="", flush=True)

视觉输入在同一消息中接受 base64 编码的图像和文本。这就是从截图到代码的完整工作流程:

text
1import base64
2from pathlib import Path
3
4image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()
5
6completion = client.chat.completions.create(
7 model="kimi-k3",
8 messages=[
9 {
10 "role": "user",
11 "content": [
12 {
13 "type": "image_url",
14 "image_url": {"url": f"data:image/png;base64,{image_data}"},
15 },
16 {"type": "text", "text": "用 HTML 和 Tailwind 重建这个着陆页。"},
17 ],
18 }
19 ],
20)
21print(completion.choices[0].message.content)

为什么这能触及那些从未接触权重的人

坦白说:几乎没有人会自行托管 2.8 万亿参数。即使有稀疏性,硬件成本也远超业余爱好者的范围,也超出了大多数公司的承受能力。

但这从来就不是重点。公开权重为封闭实验室对类似能力的定价设定了上限。第三方托管商将竞相以商品化利润提供 K3 服务,这与之前每一次重大开源发布时的动态相同。整个市场的价格都会向开源基准靠拢。

这种好处会通过你现有供应商的账单体现出来,无论你是否下载过任何文件。

实用操作指南

喂给它完整的东西。完整的代码仓库供审查,完整的合同文件夹,整个内容库。停止分块那些不再需要分块的内容。

让它长时间运行。排队进行多小时的工程会话,稍后检查结果。缓存会消耗每次重读的成本。

把摄像头对准问题。截图一个着陆页,要求重建。拍下白板,要求实现。

让琐碎流量远离它。一个始终以最高水平推理的模型,不适合快速、高并发的调用。把这些路由到别处,把 K3 留给值得它处理的工作。

十天倒计时

三年来,前沿是一种你租用的东西,条款由他人设定,价格可能随时改变而无预警。

7 月 27 日,它变成了一份文件。而文件,不同于订阅,是你拥有的东西。

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章