◆ Stacks
KIMI K3
SemiAnalysis · 2026-08-03 · 原文: EN

Kimi K3が節約したメモリは、実際のサーバーまでそのまま届かない

Stacksアプリで見る → 元記事を読む ↗

Kimi Linearは、性能と効率の均衡を取る理想的なKDA対MLAの比率が3対1であることを示した。

これは、KDAのような線形アテンションがKVキャッシュのメモリ消費を大きく減らすとしても、実際の運用では一定量のKVキャッシュメモリしか使わないわけではないことを示している。

SemiAnalysis · 2026.08.03 · 英語の原文より翻訳

7月27日にムーンショットAIが重みを公開したKimi K3を、分解した分析が出た。 このモデルがアテンションを二種類混ぜて使う理由は、性能ではなくメモリだった。

Kimi K3が来た: vLLMの当日サポート (vLLMブログ, 2026-07-27)
출처: vllm-project.github.io

このモデルを実際に動かす推論エンジンvLLMは、その設計を 「膨らむKVキャッシュの代わりに固定サイズの再帰状態を保つ線形アテンション」と記している。

キャッシュが育たないという意味

言葉を次々に紡ぐモデルは、すでに読んだ内容を毎回計算し直さないように途中結果を抱えている。 その荷物がKVキャッシュだ。 会話が長くなるほど荷物は比例して重くなり、その重さはそのままGPUのメモリを食う。 線形アテンションは、前の内容をひとつの固定された状態に押し込める。 文章がどれだけ長くなっても、荷物の大きさは変わらないということだ。 Kimi K3は、この方式と前をすべて覚える従来方式を3対1で交互に積んでいる。 総計2兆8,000億規模のパラメータのうち一つのトークンで実際に働くのは一部で、一度に読める長さは100万トークンだ。

32,000トークンごとに一度つなぎ留める

ここで運用側の事情がひとつ引っかかる。 同じ会話の前半を再利用するには、その地点の状態が保存されていなければならない。 だが固定状態は先へ進むと上書きされるので、戻る目印を別に残す必要がある。 vLLMは一定間隔で状態をチェックポイントとして残す方式を採ると書いており、例として挙げた間隔が32,000トークンだ。 この値は設定で変えられる既定の例であって、固定された定数ではない。 間隔を詰めればメモリが増え、広げれば次のリクエストが前半を計算し直す。 つまり実運用では、このモデルのメモリ使用量は一定に保たれない。

HBMGPUに付く最速のメモリ。まずモデルの重みが席を取り、残った分だけキャッシュが入る
サーバーDRAMHBMが埋まるとキャッシュはここへ流れ落ちる。容量は大きく帯域は狭い
SSDDRAMも溢れれば、最後はここまで降りてくる

荷物が一段下がるたびに、最初の一文字が出るまでの時間が延びる。キャッシュを減らす技術に値がつくのは、この階段があるからだ。

サーバーに挿すDRAMのモジュール。HBMから押し出されたKVキャッシュが降りてくる場所がここだ。
サーバーに挿すDRAMのモジュール。HBMから押し出されたKVキャッシュが降りてくる場所がここだ。 · Smial · FAL 1.3

安いことと、メモリを使わないことは別だ

Kimi K3は公開直後、アーティフィシャルアナリシスの総合知能指数で3位に入った。 同じ集計で、タスク一件を処理する費用は次のように分かれた。

Kimi K30.94ドル
GPT-5.6 Sol1.04ドル
オーパス4.81.80ドル

スコアが近い位置にあるモデル同士でも、値段は二倍近く開く。オープンウェイトのモデルが選ばれる理由は、ベンチマークではなくこの欄にある。

Artificial Analysis 総合知能指数の集計(2026-07-17公開 · 2026-08-05取得)

Kimi K3、アーティフィシャルアナリシスの知能指数で3位に (Artificial Analysis, 2026-07-17)
출처: artificialanalysis.ai

アーティフィシャルアナリシスは、Kimi K3の成績はオーパス4.8やGPT-5.5に比肩し、上位にいるモデルは二つだけだと記した。 安くなる経路が、チップを買い増す側から、同じ答えをより少ないメモリで出す側へ移りつつあるということだ。 ただし節約されたメモリが、そのまま需要の減少になるわけではない。 キャッシュが軽くなれば同じ機材でより長い文脈と同時利用者を受けられるようになり、空いた場所はまた埋まる。

ムーンショットがライセンスに引いた線

重みは公開されているが、誰もがそれで商売できるわけではない。 開発者のサイモン・ウィリソン氏は、年間売上2,000万ドルを超える事業者はムーンショットと別途の商用契約が要ると指摘した。 自分で動かす側には開かれ、これを売って稼ぐ側には扉が半分閉じている。 次のモデルがこの設計をどちらへ押すかが分かれ道だ。 ムーンショットがKimi K4で前をすべて覚える層まで取り払えば、メモリを削る側に賭けたことになり、 逆にその層を増やし直せば、キャッシュ削減の利得は実運用では見かけほど大きくなかったということだ。

3行まとめ

出典

  1. 原文 SemiAnalysis, Kimi K3, The Manos, The Mythos, The Legendos · 2026-08-03
  2. vLLMブログ Kimi K3 Is Here: Efficient Day-0 Support on vLLM · 2026-07-27 · 固定サイズの再帰状態と32,000トークンのチェックポイント間隔の一次出典
  3. Artificial Analysis 総合知能指数3位、タスク当たり0.94ドルの集計 · 2026-07-17公開 · 2026-08-05取得
  4. サイモン・ウィリソン Kimi K3のライセンス解説 · 年商2,000万ドル超の事業者に求められる商用契約 · 2026-07-27

2026-08-05取得 · 費用と順位はArtificial Analysisが2026-07-17に公開した集計 · パラメータ数と文脈長はムーンショットAIの公開仕様で、トークン当たりの実働規模は公式値がない。

この筆者の記録

6記事4方向性コール3強気1弱気
記録をすべて見る →