Kimi K3 が AI サブスクリプション時代を終わらせる

@0xDominiqq
英語3 日前 · 2026年7月18日
275K
83
12
4
176

TL;DR

Moonshot AI の Kimi K3 は、2.8 兆パラメーターのオープンウェイトモデルであり、100 万トークンのコンテキストウィンドウを備えています。Mixture-of-Experts(MoE)と革新的なアテンションメカニズムを活用することで、コストを劇的に削減し、クローズド API の優位性に挑戦します。

見出しの数字は本題ではない

7月27日、Moonshot AI は Kimi K3 の完全な重みを修正 MIT ライセンスの下で公開しました。スペックシートは誇示のように見えます:2.8 兆パラメータ、100 万トークンのコンテキストウィンドウ、そしてこれまでにリリースされた最大のオープンウェイトモデルという称号で、DeepSeek V4 Pro よりも約 75% 大きいです。

しかし、そのサイズはおとりです。本当の話は、フロンティアレベルの知能へのアクセスを誰が管理するかという変化です。3 年間、最高のモデルは API の背後にありました。あなたはレンタル料を払い、大家が条件を決め、ベンダーがエンドポイントの価格を変更したり、モデルの動作をこっそり変えたりすれば、あなたの製品がその損害を被りました。

オープンウェイトはその取り決めを破ります。ファイルが公開されれば、どのラボもその能力を取り戻すことはできません。その単一の事実が、一切のシャードをダウンロードしない人々を含む、すべての人の経済を変えます。

スペック一覧

仕様

パラメータ

2.8 兆

エキスパート

合計 896、トークンあたり 16 アクティブ

コンテキストウィンドウ

1,048,576 トークン

ライセンス

修正 MIT ライセンス

ウェイト公開日

7月27日

DeepSeek V4 Pro とのサイズ比較

約 75% 大きい

K2 とのスケーリング効率

約 2.5 倍

料金

レート

入力(キャッシュヒット)

$0.30 / 100 万トークン

入力(キャッシュミス)

$3.00 / 100 万トークン

出力

$15.00 / 100 万トークン

2.8T モデルが 2.8T の請求を回避する方法

このサイズの高密度モデルは使用不可能でしょう。すべてのトークンですべてのパラメータを実行することは、すべての兆規模モデルが直面する壁です:遅すぎる、高すぎる、物理法則を回避する方法はありません。

K3 は、積極的な Mixture-of-Experts 設計でそれを回避します。モデル内部には 896 の専門家サブネットワークが存在します。任意のトークンでは、そのうちの 16 だけが作動します。2.8 兆パラメータの蓄積された知識を得ながら、そのサイズのごく一部のモデルの推論コストを支払います。

これがスパース性であり、K3 はこれまでのどのオープンモデルよりもそれに依存しています。K2 はそのアプローチが機能することを証明しました。K3 はそれを中核的な賭けに変えます。

Dominique - inline image

重労働を担った 2 つの研究論文

2 つのアーキテクチャ変更が残りを可能にし、両方ともモデルが出荷される前にオープンリサーチとして公開され、そのため Moonshot はベンチマークが登場する前に研究者からの信頼を得ました。

1 つ目は Kimi Delta Attention、ハイブリッド線形アテンション機構です。標準的なアテンションのコストはコンテキストが長くなるにつれて二次的に増加するため、100 万トークンのウィンドウは通常マーケティングデッキに留まります。KDA は異なるスケーリングをし、その違いこそが、誰もが実際に支払える価格で 1M ウィンドウが存在する唯一の理由です。

2 つ目は Attention Residuals、標準的な残差接続の代替品です。Moonshot は、一貫したスケーリングの利得をそれに帰し、通常の劣化なしでより深いモデルを構築できるようにしました。彼ら自身の数値によれば、この組み合わせは K2 の約 2.5 倍のスケーリング効率を提供します。

100 万トークンが排除するもの

Dominique - inline image

本番 AI の検索インフラのほとんどは、回避策として存在しています。チャンク分割、埋め込み、ベクトルデータベース、RAG パイプライン:それらすべては、一度に十分なワーキングメモリを保持できないモデルを補っています。

100 万トークンがデフォルトを変えます。コードベース全体が単一のプロンプトに入ります。1 年分の内部文書。50 のビデオ文字起こし。すべてが同時にアテンションに存在し、モデルは検索された断片をつなぎ合わせて継ぎ目が持つことを願う代わりに、コーパス全体にわたって推論します。

ネイティブビジョンは入力面をさらに広げます。スクリーンショット、ホワイトボードの写真、アーキテクチャ図、チャートは、周囲のコードやテキストと同じコンテキストで読み取り可能です。K3 の最も強力なベンチマーク勝利がフロントエンドコーディングで得られたのは偶然ではありません:モデルはデザインを見て、1 つのコンテキストウィンドウ内で実装を書きます。

ベンチマークよりも重要な料金表

記載されたレート:キャッシュヒット時は入力 100 万トークンあたり $0.30、キャッシュミス時は $3.00、出力 100 万トークンあたり $15.00、コンテキストは 1,048,576 トークン。

キャッシュの数字は注目すべきものです。Moonshot は、長時間のコーディングセッションで 90% 以上のキャッシュヒット率を報告しています。エージェントが実際に何をするかを考えてみましょう:同じリポジトリを何時間も何度も読み直します。キャッシュなしでは、毎回全額の入力価格を支払います。キャッシュがあれば、長時間セッションのコストは約 4 分の 1 にまで下がります。

長期的なエージェントはまさにこの計算で生きるか死ぬかします。K3 は、最小限の監督で何時間も実行し、リポジトリをナビゲートし、ターミナルツールを調整し、自身の作業をチェックするセッション向けに構築されています。料金体系がプロダクトです。

誰も見逃してはいけない落とし穴

K3 にはエコノミーモードがありません。推論は常にオンで、最大に固定されています。独立したテスターは、些細な SVG リクエストで 13,000 以上の思考トークンを消費し、使い捨てクエリに約 $0.25 かかるのを目撃しました。

教訓はルーティングです。迅速で安価な大量の呼び出しは、より小さなモデルに属します。K3 は、コンテキストサイズとタスクの複雑さが常時オン推論を正当化する場合にのみ、そのコストに見合います。汎用チャットエンドポイントとして使用することは、金を燃やすようなものです。

接続は 5 分で完了

API は OpenAI 互換です。base_url とキーを交換し、既存のコードをそのまま使えます:

text
1from openai import OpenAI
2import os
3
4client = OpenAI(
5 api_key=os.environ["MOONSHOT_API_KEY"],
6 base_url="https://api.moonshot.ai/v1",
7)
8
9completion = client.chat.completions.create(
10 model="kimi-k3",
11 messages=[{"role": "user", "content": "Introduce Kimi K3 in one sentence."}],
12)
13print(completion.choices[0].message.content)

推論はトップレベルのフィールドで設定され、現在は "max" のみを受け付けます:

text
1completion = client.chat.completions.create(
2 model="kimi-k3",
3 reasoning_effort="max",
4 messages=[{"role": "user", "content": "Prove that the square root of 2 is irrational."}],
5)
6print(completion.choices[0].message.content)

ストリーミングは標準的な方法で機能し、推論は別のデルタフィールドで到着するため、思考と回答を独立してレンダリングできます:

text
1stream = client.chat.completions.create(
2 model="kimi-k3",
3 messages=[{"role": "user", "content": "Explain why the sky is blue."}],
4 stream=True,
5)
6
7for chunk in stream:
8 delta = chunk.choices[0].delta
9 reasoning = getattr(delta, "reasoning_content", None)
10 if reasoning:
11 print(reasoning, end="", flush=True)
12 if delta.content:
13 print(delta.content, end="", flush=True)

ビジョン入力は、同じメッセージ内のテキストとともに base64 エンコードされた画像を受け取ります。これがスクリーンショットからコードへのワークフローの全体です:

text
1import base64
2from pathlib import Path
3
4image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()
5
6completion = client.chat.completions.create(
7 model="kimi-k3",
8 messages=[
9 {
10 "role": "user",
11 "content": [
12 {
13 "type": "image_url",
14 "image_url": {"url": f"data:image/png;base64,{image_data}"},
15 },
16 {"type": "text", "text": "Rebuild this landing page in HTML and Tailwind."},
17 ],
18 }
19 ],
20)
21print(completion.choices[0].message.content)

これがウェイトに触れない人々に届く理由

正直なところ、ほとんど誰も 2.8 兆パラメータをセルフホストしないでしょう。スパース性があっても、ハードウェア代は趣味の範囲をはるかに超え、ほとんどの企業も超えています。

それがポイントでは決してありませんでした。公開ウェイトは、クローズドラボが同等の能力に対して請求できる金額に上限を設けます。サードパーティのホストは、コモディティマージンで K3 を提供するために互いに競争するでしょう。これは、これまでの主要なオープンリリースごとに展開されたのと同じ力学です。市場全体の価格は、オープンベースラインに向かって推移します。

その恩恵は、あなたがすでに使用しているプロバイダーの請求書を通じてあなたに届きます。ファイルをダウンロードするかどうかに関係なく。

実践的なプレイブック

全体をそのまま与えよ。レビュー用の完全なリポジトリ、契約書フォルダ全体、コンテンツライブラリ全体。もはやチャンク分割を必要としないものをチャンク分割するのをやめよ。

長時間実行せよ。数時間のエンジニアリングセッションをキューに入れ、後で結果を確認せよ。キャッシュが再読み込みのコストを吸収する。

問題にカメラを向けよ。ランディングページをスクリーンショットし、再構築を依頼せよ。ホワイトボードを写真に撮り、実装を依頼せよ。

些細なトラフィックをそれに乗せないようにせよ。常に最大で推論するモデルは、迅速で大量の呼び出しには間違ったツールだ。それらは別の場所にルーティングし、K3 はそれに値する作業のために取っておけ。

10 日間のカウントダウン

3 年間、フロンティアはあなたが借りるものであり、あなたが設定しない条件で、警告なしに変更される可能性のある価格で提供されていました。

7月27日、それはファイルになります。そしてファイルは、サブスクリプションとは異なり、あなたが所有するものです。

YouMindで再制作

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る