Kimi K3 : Fable 5 を凌駕したオープンモデルの完全ガイド

@kirillk_web3
英語2 日前 · 2026年7月19日
235K
78
16
13
156

TL;DR

Kimi K3 は、Moonshot AI が開発した 2.8 兆パラメータのオープンソースモデルであり、Fable 5 のようなトップクラスの独自モデルに匹敵します。高速かつ長文脈のコーディングを実現する革新的なアーキテクチャと、自律的な自己改善機能を備えています。

これは Kimi K3 が実際に何なのか、何ができるのか、そしてなぜ今誰も話題にしていないのに静かに最も重要なコーディングモデルになりつつあるのかを、A から Z まで完全に解説したものです。

このページをブックマークしておけば、この記事を失うことはありません。

2.8 兆パラメータ。100 万トークンのコンテキスト。

ここにすべてをまとめました。

ベンチマークの話をする前に、今何が起きたのかを話そう

この 3 年間、同じストーリーが繰り返されてきました。アメリカのラボが最先端を築き、6 か月後に中国のラボが安価なコピーを作る。

7 月 16 日、Moonshot AI は Kimi K3 をリリースしました。

https://x.com/Kimi_Moonshot/status/2077830229968683203

総パラメータ数 2.8 兆 — DeepSeek の V4 Pro よりも約 75% 大きく、Zhipu の GLM 5 シリーズの約 4 倍。これまでにリリースされた中で最大のオープンソースモデルです。

Claude Opus 4.8 を上回る性能。GPT-5.6 Sol も上回ります。そして Moonshot のベンチマークでは、現在一般公開されている中で最も高性能なモデルである Fable 5 と同等の性能を発揮します。

もはやコピーストーリーは終わりました。

数字

Kirill - inline image

最後の行は、多くの人が誤って読んでいる部分です。正しく理解しましょう。

価格設定の現実 — 注意深く読んでください

Kimi K3 は割引モデルではありません。100 万トークンあたり $3/$15 で、おおよそ Claude Sonnet レベルの価格設定です。Moonshot の以前のリリースが提供していたような大幅な割引ではありません。

では、「Fable 5 より 5 倍安い」というのはどこから来ているのでしょうか?

トークン単価ではなく、タスクあたりのコストです。

K3 は同じ作業を完了するために必要な出力トークンが大幅に少なくなります。代表的なコーディングタスクの場合:Fable 5 は約 $1.30 かかります。K3 は約 $0.25 です。

同じ出力レベル。より少ないトークン。より低い総請求額。

正直な表現はこうです:Sonnet の価格で、Fable レベルの体験。 あなたは市場で最も安いトークンを買っているのではありません。ミッドレンジの価格で最先端の能力を購入し、より少ないステップでそこに到達しているのです。

トークンの単価を比較するなら、K3 は平凡に見えます。仕事を完了するのにかかるコストを比較するなら、まったく別の話になります。

Kimi K3 が最先端である領域

Moonshot が公開したベンチマークによると、K3 は以下の項目で SOTA(最高水準)を達成しています:

  • ツール併用の HLE — Humanity's Last Exam、ツール拡張版
  • SWE-Bench Pro — 実世界のソフトウェアエンジニアリング
  • SWE-Bench Multilingual — 複数言語にわたるエンジニアリング
  • BrowseComp — Web ブラウジングとリサーチ
  • Toolathlon — 大規模なツール使用
  • CharXiv with Python — チャートと図の推論
  • MathVision with Python — 視覚数学
Kirill - inline image

競合との比較:Opus 4.8 と GPT-5.6 Sol を上回り、Fable 5 と同等。

AI 評価プラットフォーム Arena によるブラインドテストでは、開発者は主要な米国モデルすべてよりも Kimi を好みました。

実際に重要な 2 つのアーキテクチャ革新

これこそ、ほとんどの報道が飛ばしている部分であり、今回のリリースで最も興味深い点です。

Kirill - inline image
  • Kimi Delta Attention (KDA)

ハイブリッド線形アテンション機構。その結果:100 万トークンのコンテキストで、デコード速度が最大 6.3 倍に向上。

100 万のコンテキストウィンドウは、その中で実際に待たずに作業できなければ意味がありません。KDA は、コンテキストウィンドウを理論上のものではなく実用的なものにするための仕組みです。

  • Attention Residuals (AttnRes)

残差接続のドロップイン代替品。トレーニング効率を約 25% 向上させ、追加コストは 2% 未満です。

どちらの技術も、モデル出荷前に Moonshot チームによって GitHub でオープンリサーチとして公開されました。これはマーケティングではなく、ピアレビュー可能な成果です。

そして、これらが組み合わさることで、トークン効率が説明できます。K3 は同等のタスクにおいて、K2.6 よりも 出力トークンが 21% 少なく なっています。

注目すべき点:K3 は自身のアーキテクチャを最適化した

Moonshot は K3 に Attention Residuals(自身のアーキテクチャコンポーネント)の実装と、数値的な振る舞いを変えずに H200 ハードウェア上で高速化するという 1 つの目標を与えました。

そして、そのまま放置しました。

20 時間の実験。人間の介入はゼロ。1.6 倍の高速化。

別の実行では、K3 は FLA Triton AttnRes のフォワード/バックワード時間を 283.6ms から 114.4ms に短縮、2.48 倍の高速化 を達成しました。これも数値は変えていません。

Kirill - inline image

そして、同じタスクを行う Fable 5 よりも高速に反復処理を行いました。

もう一度読んでください。モデルが、モデルを動作させるメカニズムを改善したのです。自律的に。一晩で。

これが「再帰的自己改善」の実際の姿です。SF のシナリオではなく、測定可能な結果を伴う 20 時間の仕事です。数週間前に Anthropic が警戒すべき理由として指摘したのと同じ能力が、7 月 27 日に誰でもダウンロードできるオープンウェイトモデルで動作しているのです。

長期コーディングこそがすべてのポイント

Moonshot 自身の表現:「K3 は、Moonshot AI がこれまでにリリースした中で最も強力なオープンソースコーディングモデルです。人間の監督を最小限に抑え、長時間のエンジニアリングセッションを継続し、巨大なリポジトリをナビゲートし、ターミナルツールをオーケストレーションできます。」

実際のエンジニアリング作業に重要な 3 つの要素:

  1. 持続的なセッション — 20 時間の自律実験はデモではありません。設計目標です。
  2. 巨大なリポジトリ — 100 万トークンのコンテキストと 6.3 倍の高速デコードにより、実際のコードベースをコンテキストに取り込んで実際に作業できます。
  3. ツールオーケストレーション — Toolathlon と BrowseComp で SOTA を達成しているため、ターミナル、ブラウザ、API 呼び出しを問題なく処理できます。

フロントエンドコーディングは Fable 5 レベルに達します。単一のプロンプトから AAA 品質のゲームシーン。WebGPU、Three.js、シェーダー、物理演算 — かつてはスタジオが必要だったもの。

Kimi K3 での Vibe Coding

ここで、モデルはベンチマークの数字ではなくなり、明らかに有用なものになります。

K3 のフロントエンドコーディングは Fable 5 レベルです。実際には、説明と動作する 3D プロダクトの間の壁が、今や 1 つのプロンプトになったことを意味します。

単一のプロンプトから実際に人々がリリースしたもの:

ゲーム — VFX 付きの WebGPU バトルアリーナ。グラップリングメカニクスによるブラウザベースの 3D 都市探索。

  1. ゾンビ FPS。
  2. マルチプレイヤーレーシング。
  3. 動作する 3D GBA エミュレーター。
  4. 完全な MMORPG の骨組み。

「ゲームのようなデモ」ではありません。ヒットリアクション、インパクトフィードバック、物理演算が正しく動作するプレイ可能なシーンです。

Kirill - inline image

実際のマテリアルワークを伴う 3D オブジェクト — 正しい光沢と光の挙動を持つロレックス。33 個の個別にモデリングされたパーツで組み立て・分解される CSGO 武器。ソニーカメラの分解表示。重力レンズ効果のあるブラックホール。実際の波のダイナミクスを備えた海洋シミュレーション。

Kirill - inline image

物理シーン — 布地シミュレーション。構造物の崩壊。運動量の移動が正しく、スクリプトで動かしているように見えない車両衝突。

これが以前の「AI が Web サイトを構築する」デモと異なる点:K3 は通常破綻する細部を処理します。照明。影。マテリアルの光沢。「明らかに AI が生成した」と「誰かが作った」を分ける 20 の小さなこと。

1 つのプロンプト。400 万トークン。かつてはチームが必要だったシーン。

4 つの実戦テスト済みプロンプト(コピペ準備完了)

これらは、K3 が実際に得意とするもの、つまり長期作業、ツール使用、大きなコンテキストを維持して逸脱しないことを活用するように構成されています。

プロンプト 1 — 物理演算のストレステスト

これは、実際の能力とデモの見せかけを区別するプロンプトです。モデルが 3 つのシーンすべてを品質良く実行できれば、本物です。

text
1実際の物理演算を備えた、自己完結型の HTML5 キャンバスシーンを 3 つ構築してください。
2外部ライブラリは使用しないでください。すべて 1 ファイルに収めてください。
3
4シーン 1: 壊れた橋から水中に脱線する列車。
5含めるもの: 車両の運動量、橋の構造的崩壊、
6着水時の水の変位。
7
8シーン 2: ランプから飛び出し、空中で衝突する 2 台の車。
9渓谷の上。含めるもの: 正しい軌道弧、
10衝突時の運動量移動、破片。
11
12シーン 3: モンスタートラックが駐車中の車の列を押しつぶす。
13含めるもの: サスペンションの圧縮、板金の変形、
14重量配分。
15
163 つすべての要件:
17- 物理演算は計算されたものであり、アニメーション化されたものではないこと
18- 60fps を目標
19- リセットボタンを含める
20- 物理演算の計算式にコメントを付けて、検証できるようにする
21
223 つすべてを構築してください。質問はしないでください。

プロンプト 2 — 長期リポジトリタスク

これは K3 が本来のために作られたものです。実際のコードベースを指定し、タスクではなく成果を指示します。

text
1何かを書く前に、このコードベース全体を読んでください。
2
3[リポジトリを貼り付けるか、ディレクトリを指定]
4
5目標: [測定可能な成果を述べてください — 例:「p95
6API 応答時間を 30% 削減」または「データレイヤーの
7N+1 クエリをすべて排除」]
8
9ルール:
10- 最初にプロファイリングしてください。何かを変更する前に、
11 実際に時間がどこで使われているかを示してください。
12- パブリックインターフェースや数値的な振る舞いは変更しないでください。
13- 各変更後に既存のテストスイートを実行してください。
14- 変更によって状況が悪化した場合は、元に戻して理由を説明してください。
15- 目標が達成されるか、ルールを破らずには達成不可能であることを
16 証明できるまで作業を続けてください。
17
18最後に報告: 何を変更したか、その効果、試したが
19うまくいかなかったこと。

「試したがうまくいかなかったこと」という行が重要です。これにより、出力が差分からエンジニアリングログに変わります。

プロンプト 3 — 3D プロダクト構築

フロントエンド、ランディングページ、プロダクトビジュアライゼーションを行う人向け。

text
1ブラウザ上でインタラクティブな 3D [オブジェクト] を構築してください。
2単一の HTML ファイル。Three.js を使用。
3
4オブジェクト: [マテリアル、パーツ数、動く部分を正確に記述]
5
6必須:
7- 正しいマテリアルプロパティ(光沢度、粗さ、
8 該当する場合は金属度)
9- リアルな影を伴う 3 点照明
10- オービットコントロール
11- [任意のインタラクション — 組み立て/分解、アニメーション、
12 ホバー状態]
13
14品質基準: これは WebGL のデモではなく、プロダクトレンダリングのように
15見える必要があります。現実に目に見える細部は、すべてモデリングしてください。
16
17全体を構築し、ファイルを見せてください。

「品質基準」の行は、プロンプト内の他の何よりも効果を発揮します。K3 は指示だけでなく、基準に応答します。

プロンプト 4 — 可動部分を伴うリアルタイム機能

フルスタック CRUD はアプリの 1 つの形です。リアルタイムはまったく別の形です。状態はデータベースに永続化するだけでなく、クライアント間で同期を維持する必要があります。ここで多くのモデルが静かに崩壊します。

text
1既存のアプリにリアルタイム機能を追加してください。Figma のような
2ライブ共同カーソル + コメントシステムです。
3
4要件:
5- WebSocket 接続(Socket.io またはネイティブ ws を使用)
6- 他の接続ユーザーのカーソル位置をリアルタイムで表示
7- 任意の場所をクリックしてコメントピンをドロップ
8- コメントは接続されているすべてのクライアントにライブ更新
9- 切断/再接続を適切に処理 — ゴーストカーソルなし
10- カーソル更新をデバウンスして、ソケットが溢れないようにする
11
12構築:
131. WebSocket サーバーをセットアップ
142. 自動再接続機能付きのクライアント側接続を構築
153. デバウンス付きのカーソルブロードキャストを実装
164. コメントピンシステムを実装
175. シンプルなプレゼンスインジケーター(誰がオンラインか)を追加
186. 少なくとも 2 つのシミュレートクライアントでテストし、同期が
19 機能することを確認
20
21これを完了と呼ぶ前に、マルチクライアント同期をどのようにテストしたか
22示してください。

期待される結果: 15 ~ 30 分で動作するリアルタイムレイヤー。複数のクライアントに対してテストされたという目に見える証拠があります。

Kirill - inline image

最後の行が重要です。リアルタイムのバグは、ブラウザタブを 1 つ開いているだけでは現れません。2 つ開くと現れます。マルチクライアントテストをスキップするモデルは、完成しているように見えて実際はそうでないコードを渡します。

K3 がうまくいかないとき:トラブルシューティングガイド

新しいモデルであり、実際に粗い部分もあります。何が壊れるか、どう対処するかを説明します。

  • 問題:些細なタスクでトークンを消費する

これは大きな問題であり、構造的なものです。

K3 は現在、'max' という 1 つの推論努力レベル しか提供していません。「すぐに答える」モードはありません。独立したテスターは、単純な SVG を生成するために 13,241 の推論トークン を消費したと報告しています。これは、数分の 1 セントで済むはずのものに、約 $0.25 かかっていることになります。

修正方法:

単純な作業を K3 にルーティングしないでください。これは 1 つのギアしか持たない最先端モデルであり、そのギアは「すべてについて深く考える」です。定型文、フォーマット、機械的な作業には K2.7 またはより小さなモデルを使用してください。K3 は推論を正当化する作業のために取っておいてください。

これは、最初の 1 か月で人々が犯す最大の過ちです。K3 をすべてのデフォルトにして、請求書を見て驚くことです。

  • 問題:とにかくコンテキストウィンドウがいっぱいになる

100 万トークンは無限に聞こえますが、実際のリポジトリを入れるとそうではないことに気づきます。

修正方法:

すべてをダンプしないでください。重要なディレクトリを指定してください。K3 の長期作業における強みは、すべてのファイルをコンテキストに持つことではなく、持続的な集中力にあります。適切なコードのタイトな 200K は、モノレポ全体の肥大化した 900K よりも優れています。

  • 問題:非常に長い自律実行で漂う

20 時間の自律実験は本物ですが、目標が 測定可能 だったから機能しました。「数値を変えずに H200 でこれを高速化する」というものです。曖昧な目標と長いリードを与えると、迷走します。

修正方法:

すべての長期プロンプトには、検証可能な成功条件が必要です。「コードを改善する」ではありません。数値、合格するテスト、動くベンチマークです。成功したかどうかを確認する方法を述べられなければ、モデルは迷走します。

  • 問題:誰かのベンチマーク結果を再現できない

Moonshot の外部では、誰もこのモデルを監査していません。ウェイトは 7 月 27 日まで公開されません。現在出回っているすべての数字(この記事の数字も含む)は、ベンダー報告によるものです。

修正方法:

7 月 27 日を待つか、自分のタスクでテストして、その結果を信頼してください。あなたの実際の 5 つのタスクは、誰かのベンチマーク表よりも価値があります。

  • 問題:OpenAI または Anthropic からの切り替え後の統合エラー

K3 は OpenAI SDK と互換性があり、移行の 90% を処理します。残りの 10% は通常、推論動作です。K3 はデフォルトで推論し、応答処理で予期していない可能性のある推論トークンを返します。

修正方法:

モデルが壊れていると仮定する前に、トークンのアカウンティングと応答の解析を確認してください。ほとんどの「K3 は高い」という苦情は、実際には「推論トークンが出力トークンであることを忘れていた」というものです。

誰も無視すべきでない背景

Moonshot は北京に拠点を置き、元 Google 研究者の Yang Zhilin によって設立され、Alibaba が出資しています。

https://x.com/kirillk_web3/status/2057528102368977328

彼らは、先端半導体に対する米国の輸出規制がエスカレートする 3 年未満の間に、2.8 兆パラメータの最先端モデルを構築しました。

バンク・オブ・アメリカのアナリストは率直に述べています:「中国のハードウェア/コンピュート容量の制約が続いているにもかかわらず、K3 は、アーキテクチャの革新と組み合わせた事前学習のスケーリングが、中国のフラッグシップモデルに飛躍的な進歩をもたらし続けることができることを示しています。」

そしてタイミングは偶然ではありません。K3 は 2026 年世界人工知能会議(上海) の数日前に登場しました。

7 月 27 日の問い

ウェイトは 7 月 27 日に公開されます。この日付は、発売日よりも重要です。

それまでは、K3 は API を通じて使用できる最先端モデルです。印象的です。

7 月 27 日、それは別のものになります。誰でもダウンロード、検査、変更、自分のハードウェアで実行できる最先端クラスのモデルです。API なし。使用制限なし。利用規約なし。30 日間のプロンプト保持もありません。

それが実際のストーリーです。「中国が追いついた」ではありません。

中国は追いつき、それを無料で提供したのです。

Kirill - inline image

注目すべき点:中国の規制当局は、独自の AI 輸出規制について議論しています。K3 が中国からの最後の最先端オープンウェイトリリースとなるのか、それとも多くの最初のものとなるのかは、現時点では本当に不明です。

試す方法

チャット: kimi.com — K3 は現在利用可能です

API: OpenAI SDK 互換のため、すでに OpenAI または Anthropic のツールチェーンで構築している場合、統合は設定変更だけで、書き直しは必要ありません

ウェイト: 7 月 27 日

SDK 互換性は、聞こえる以上に重要です。モデルを交換するには通常、統合レイヤーを書き直す必要があります。ここでは、ベース URL とモデル文字列を変更するだけです。

Kimi Code のインストール方法(ターミナルエージェント)

チャットウィンドウではなく、実際のコードベース内で K3 を実行したい場合、これがセットアップです。

Kirill - inline image

要件:

  • コンピュータ(Mac、Windows、または Linux)
  • ターミナルアクセス
  • Kimi アカウント — kimi.com

ステップ 1 — Kimi Code をインストール

Mac/Linux:

bash
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

Windows (PowerShell):

text
1irm https://code.kimi.com/kimi-code/install.ps1 | iex

Windows では、最初に Git for Windows をインストールしてください。Kimi Code CLI は、そのバンドルされている Git Bash をシェル環境として使用します。

インストールを確認:

bash
1kimi --version

macOS Gatekeeper のため、初回実行には著しく時間がかかる場合があります。システム設定 → プライバシーとセキュリティ → デベロッパツール でターミナルアプリを追加すると、以降の起動が高速化されます。

すでに uv がインストールされている場合は、直接インストールできます:

bash
1uv tool install --python 3.13 kimi-cli

Kimi Code CLI は Python 3.12 ~ 3.14 をサポートし、互換性の点で 3.13 が推奨されます。

ステップ 2 — プロジェクトに移動して起動

bash
1cd your-project
2kimi

初回起動時に、セッション内で /login を実行して API ソースを設定します。ブラウザウィンドウが開き、OAuth が行われます。

ステップ 3 — タスクを与える

Kimi Code がプロジェクト内で実行され、すべてのファイルへの直接的な読み取り/書き込みアクセスが可能になります。タスクを平易な英語で説明してください。ステップを計画し、コードを編集し、テストを実行し、何をしたかを報告します。

これが実際に意味すること

プロダクションワークロードを実行している場合:

切り替える前にテストしてください。 ベンダーベンチマークと実際のパフォーマンスは常に乖離します。実際のタスクを 5 つ選び、K3 と現在のモデルを並行して実行し、トークンあたりのコストではなく、完了したジョブあたりのコストを測定してください。

Kirill - inline image

タスクあたりの計算がすべての論拠です。 $3/$15 では、K3 は書面上は安くありません。トークンが 21% 少なく、Fable レベルの出力であれば、重要なところで安くなります。

7 月 27 日で状況が変わります。 オープンウェイトとは、セルフホスティング、ファインチューニング、そして誰かの API がオンラインであり続けることや、誰かの利用規約が好ましいままであることへの依存がゼロになることを意味します。機密性の高いものにとって、これは小さなことではありません。

結論

かつて最先端は、アメリカのラボが構築し、他の誰もが 6 か月後に訪れる場所でした。

2.8 兆パラメータ。100 万コンテキスト。Fable 5 レベルのコーディングを Sonnet の価格で。輸出規制下で、部屋の中で最も低い評価額のラボによって構築され、7 月 27 日に無料で提供されます。

興味深い質問は、K3 が何らかのベンチマークで Fable 5 に勝つかどうかではありません。オープンウェイトのモデルが閉じた最先端モデルに匹敵したとき、その経済性に何が起こるかです。

リンク

フォローして、さらに Vibe Coding 情報を入手してください。お読みいただきありがとうございます!

YouMindで再制作

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る