Kimi K3 レビュー:最先端級の性能を約半額で、ただしウェイトは未公開

Kimi K3の性能、ベンチマーク、API料金、運用リスクを検証。入力$3・出力$15/100万トークン、キャッシュ入力$0.30という低価格は魅力ですが、ウェイトと技術レポートは未公開です。GPT-5.6 Sol、Claude Fable 5との比較から、試すべき用途と導入を待つべき場面を整理します。

Thursday, September 3, 2026Omid Saffari
Kimi K3 レビュー:最先端級の性能を約半額で、ただしウェイトは未公開

このKimi K3 レビューの結論は明確です。Kimi K3は、キャッシュを効かせた長時間のコーディングで試す価値はありますが、まだ標準モデルに据える段階ではありません。API料金はキャッシュなし入力100万トークンあたり$3、出力100万トークンあたり$15で、混合トークンのコストはGPT-5.6 Solのおよそ半分です。一方、予告されたモデルウェイトと技術レポートは未公開で、Kimiの公式ドキュメントも、セッション切り替え時の不安定さ、先走ったアクション、ユーザー体験の差を明記しています。

Kimi K3は2026年7月16日、コーディング、エージェント、エンドツーエンドのナレッジワークを担うMoonshot AIのフラッグシップとして登場しました。現在はKimi.com、Kimi Work、Kimi Code、またはkimi-k3 APIから利用できます。

モデルの詳細とベンチマークを掲載したKimi K3の発表ページ
Kimi K3

K3の登場が重要なのは、あらゆる面で首位だと装うことなく、最先端モデルの価格性能競争に入ってきたからです。Kimi自身も、総合力ではClaude Fable 5とGPT-5.6 Solにまだ及ばないと説明しています。この率直さがあるからこそ、より限定された強みには説得力があります。K3は、長時間にわたる本格的な処理能力を、明確に低いAPI料金で提供します。

Kimi K3 レビューの結論を比較表で確認

Kimi K3は、管理された本番トライアルには値しますが、デフォルトモデルを今すぐ置き換える候補ではありません。実務で試せるほど安く、一部のルートで勝てるだけの性能もあります。しかし、ローンチ時点の制約を考えると、全面移行は時期尚早です。

モデル最適な用途API料金(100万トークンあたり、入力 / 出力)キャッシュ入力現時点の実績最大の壁
Kimi K3キャッシュを使う長文脈コーディング、リポジトリ作業、コスト重視のエージェント試験$3 / $15$0.30Artificial Analysis Intelligence Indexで57、189モデル中#4ウェイトと技術レポートが未公開で、利用できるeffortはmaxのみ
GPT-5.6 Sol成熟したツール利用、難しい判断、幅広い本番ルーティング$5 / $30$0.501,050,000トークンのコンテキストと成熟したツール群を備える最先端モデル出力料金が高い
Claude Fable 5自律性と判断力に追加料金を払う価値がある長時間タスク$10 / $5090%のキャッシュ割引後は$1Anthropicで一般提供されている最も高性能なモデル最も高価。一部の機微なリクエストはOpus 4.8へフォールバック

判断基準は明快です。長文脈エージェントのルートでコストが制約になっているならK3を試し、トークン節約額よりミスの損失が大きいならSolまたはFableを維持します。 セルフホスティングが必須なら、実際のウェイトとライセンスが公開されるまで待つべきです。

Kimi K3とは何か

Kimi K3は、2.8兆個の全パラメータをトークンごとに動かす巨大な密(Dense)モデルではなく、インフラ規模のMixture-of-Expertsモデルです。Mixture-of-Expertsでは、各トークンを少数の専門サブネットワークへ振り分けます。K3はStable LatentMoEにより896個のエキスパートのうち16個を有効化するため、この規模でもクローズドな最先端モデルより安いAPI料金で応答を提供できます。

公式クイックスタートで確認できる主な仕様は次のとおりです。

  • パラメータ総数は2.8兆
  • コンテキストは1,048,576トークンで、長文脈向けの別料金帯を設けず、トークン料金は一定。
  • ネイティブな画像理解に対応し、テキストと画像を入力してテキストを返す。
  • Kimi Delta Attentionは、長いシーケンスを通して情報を効率よく運ぶためのハイブリッドなアテンション設計。
  • Attention Residualsは、すべての層を均一に積み重ねるのではなく、モデルの深さをまたいで有用な表現を取り出す手法。
  • コンテキストの自動キャッシュに対応し、キャッシュID、有効期限(time-to-live)の設定、追加のリクエストパラメータは不要。

Kimiは、こうしたアーキテクチャと学習の変更により、K2比で約2.5倍のスケーリング効率向上を実現したと説明しています。これはアプリケーションのベンチマークではなく、ベンダーによるアーキテクチャ上の主張として扱うべきです。購入側にとって重要な効果は、もっと直接確かめられます。K3は100万トークンのワークスペースを提供し、プレフィックスがキャッシュにヒットすれば、入力料金はキャッシュなしの場合の10分の1になります。

K3はすでに4つの形で利用できます。Kimi.comはチャット画面です。Kimi Workはバージョン3.1.0以降で、WindowsとApple silicon搭載Macに対応します。Kimi Codeではターミナルから/modelを使って選択できます。開発者はKimi API経由でkimi-k3モデルを呼び出します。

APIはツール呼び出し、JSON Mode、構造化出力、ツール選択の制約、動的なツール読み込みに対応します。画像入力には扱いづらい制限が1つあります。公開画像URLは受け付けないため、アプリケーション側でbase64データまたはKimiのファイル参照を送る必要があります。

Kimi K3 ベンチマークは「最先端級」であって「最上位」ではない

独立評価ではKimi K3が上位に入りましたが、低価格の裏にあるコストも見えます。速度が遅く、出力が長いのです。Artificial AnalysisはK3を57点と評価し、189モデル中#4に位置付けています。出力速度は毎秒62.0トークンで189モデル中#91、Intelligence Index全体では、平均63Mに対して130Mの出力トークンを記録しました。

K3では出力側の料金が高いため、この冗長さは無視できません。Artificial Analysisがモデル評価に費やした金額は$2,709.75です。トークン単価が安くても、比較対象のおよそ2倍の出力量になれば、採用できる成果1件あたりのコストは高くなり得ます。

Kimi自身のベンチマーク表を見ると、性能の特徴はさらに複雑です。

ベンチマークKimi K3Claude Fable 5GPT-5.6 Sol読み取り方
DeepSWE67.570.073.0このソフトウェアエンジニアリング試験ではK3が両モデルを下回る
Program Bench77.876.877.6K3が僅差で首位
Terminal-Bench 2.188.384.688.8K3はSolにほぼ並び、表中のFableの結果を上回る
FrontierSWE81.286.671.3K3は両者の中間
SWE Marathon42.035.039.0長時間タスクのこの項目ではK3が首位
GDPval-AA v2, Elo166817601748幅広い専門業務ではK3が両モデルを下回る
BrowseComp91.288.090.4ベンダーの表ではブラウジングでK3が首位

いずれも有力な結果ですが、同一条件の単純な直接対決ではありません。KimiはK3の推論強度をmax、temperatureを1.0、top-pを1.0に設定して実行しています。評価ランナーも行によってKimi Code、Claude Code、Codexと異なります。一部のFable 5の結果にはOpus 4.8へのフォールバックが含まれる可能性もあります。この表からK3を最先端級とは呼べますが、あらゆる用途で勝つモデルとは言えません。

独立評価とベンダー評価が示す実用上の結論は一致しています。K3には本番ルートへ挑戦できるだけの力がありますが、すべてのルートを置き換えられるほどの実証はまだありません。

強み
得意なこと
10 points

  • K3の料金は、キャッシュなし100万トークンあたり入力$3、出力$15で、SolとFable 5を大きく下回る。
  • キャッシュヒット時の入力は100万トークンあたり$0.30まで下がり、プレフィックスは自動的にキャッシュされる。
  • 1,048,576トークンのコンテキストに、長文脈用の別料金帯は適用されない。
  • ネイティブ画像理解、構造化出力、ツール呼び出し、動的なツール読み込みにより、エージェントに必要な中核機能をカバーする。
  • 独立評価の幅広いIntelligence Indexで189モデル中#4に入っている。
  • 完全なウェイト、最終ライセンス、技術レポートがまだ公開されていない。
  • 推論強度はmaxしか選べず、単純な処理を安く高速に振り分ける設定がない。
  • thinking history(思考履歴)が欠けたり、セッション途中でモデルを切り替えたりすると、品質が不安定になり得るとKimiが警告している。
  • KimiのWeb検索ツールは更新中で、当面は推奨されていない。
  • 独立評価では、比較対象の平均より遅く、出力が大幅に長い。

Kimi K3を試す最大の理由はAPI料金

Kimi K3を本番で試す最初の根拠はコストです。特に、コーディングセッションで安定したリポジトリのprefixを再利用できる場合に効きます。公式料金表では、100万トークンあたり、キャッシュヒット入力が$0.30、キャッシュミス入力が$3、出力が$15です。

キャッシュなしの入力100万トークンと出力100万トークンを処理する単純な条件では、直接比較は次のようになります。

  • Kimi K3: $18
  • GPT-5.6 Sol: $35
  • Claude Fable 5: $60

この意図的に単純化した処理では、K3はSolより48.6%、Fableより70%安くなります。

コーディングエージェントに近い例として、1か月に入力10Mトークン、出力1Mトークンを使い、入力のうち9Mトークンが十分安定してキャッシュにヒットするケースを考えます。Kimiによると、公式APIはコーディング処理で90%を超えるキャッシュヒット率を達成しています。ただし、自社アプリで再現できるかどうかは、リポジトリの構成とprefixの安定性次第です。

  • K3: 9 x $0.30(キャッシュ入力)+ 1 x $3(キャッシュなし入力)+ 1 x $15(出力)= $20.70
  • Sol: 9 x $0.50(キャッシュ入力)+ 1 x $5(キャッシュなし入力)+ 1 x $30(出力)= $39.50
  • Fable: 9 x $1(キャッシュ入力)+ 1 x $10(キャッシュなし入力)+ 1 x $50(出力)= $69.00

キャッシュヒットがまったくなければ、同じ処理の料金はK3が$45、Solが$80、Fableが$150です。キャッシュによってK3の価格優位が生まれるのではなく、長時間セッションでもその優位が保たれるということです。

キャッシュ利用時のKimi K3、GPT-5.6 Sol、Claude Fable 5の処理コスト比較図
入力のキャッシュヒット率が90%なら、K3は本格的な試験ルートの中で最も安くなります。

注意すべきなのは、トークン単価だけを最適化し、採用できる成果1件あたりのコストを見落とすことです。Artificial Analysisでは、比較対象の平均が63Mだったのに対し、K3は130Mの出力トークンを生成しました。レビューが増えたり、生成文が長くなったり、修正を繰り返したりすれば、出力$15という料金によって、見かけ上の節約効果が一部失われます。

個人向けメンバーシップは、APIとは別の購入経路です。Kimiの公式メンバーシップ料金では、無料のAdagioプランに6 Agent creditsと同時実行できるAgent task 1件が含まれますが、Kimi Code creditsはありません。Moderatoは月額$19からで、年払いなら月額$15となり、60 Agent creditsと1x Kimi Code creditsが含まれます。上位の月額プランはAllegrettoが$39、Allegroが$99、Vivaceが$199です。

無料プランは、K3のインターフェースや出力スタイルを確かめる用途には向いています。ただし、メンバーシップのcreditsとAPIのトークン課金は別の単位なので、本番処理のAPI評価を代替するものではありません。

デモより重要なKimi K3の本番運用上の壁

Kimi K3の本番リスクは、知能そのものではありません。セッション状態、固定された推論強度、ツール権限、成熟途上のプロダクト基盤が組み合わさる点にあります。

思考履歴を完全な状態で保持する

K3は、セッションを通じてthinking history(思考履歴)が保持された状態で受け取るよう学習されています。Kimiは、エージェントのランタイムがその履歴を落としたり、既存セッションを別モデルからK3へ切り替えたりすると、品質が大きく不安定になり得ると警告しています。単なるプロンプト形式の問題ではありません。会話途中でルートを変えると、モデルルーターの試験でK3の実力を実際より低く見積もる可能性があります。

K3の評価は新しいセッションから始め、アシスタントの完全な履歴を維持してください。SolやFableで進行中の処理について、途中でモデルIDだけを置き換える比較は避けます。

effortはmaxのみ

K3は常に推論を行い、現在reasoning_effortで指定できる値はmaxだけです。より低い設定と高い設定は予定されていますが、現時点では利用できません。そのため、単純な処理を同じエンドポイントで安く高速な推論強度へ振り分けるという、本番で役立つ調整手段がありません。

資金調達済みの創業者が難しい移行作業をデバッグするなら、max固定でも問題にならないかもしれません。一方、何千件もの一般的な分類処理を振り分ける中堅企業のCTOにとっては無駄が多くなります。すべてのリクエストをK3に担わせず、より安いモデルを併用してください。

promptより厳格にアクションを囲う

Kimiによれば、K3は長時間の作業をやり遂げるよう学習されているため、指示が曖昧だと予期しない判断を下すことがあります。実務上の対策は、人物像を長々と説明するプロンプトではありません。許可するツールの一覧、外部への書き込み前の確認、支出上限、対象ファイルパスの制限、ロールバックといった明示的なアクションポリシーです。

優れたパッチを書いても、無関係な設定まで変更するエージェントは、有用な意味で自律的とは言えません。先回りして動く能力には、影響範囲を小さくする仕組みが必要です。

Web検索ツールを前提に設計しない

KimiのAPIドキュメントでは、Web検索が更新中で、当面は推奨されていません。リサーチエージェントを作るなら、K3の公式ツールがすでに実用段階にあると見込まず、別の検索・取得レイヤーを用意する必要があります。

KimiはFable 5やSolと比べて、ユーザー体験に明確な差があることも認めています。この表現自体は広いものですが、周辺の制約を見れば意味は具体的です。セッション互換性は壊れやすく、effortのルーティングは未完成で、公式ツールの1つは移行中です。どれもモデル自体を無価値にはしませんが、妥当な試験範囲を決める材料にはなります。

オープンウェイトは7月27日まで「予告」にすぎない

2026年7月17日時点で、Kimi K3はセルフホスティングに利用できるモデルではありません。Kimiは完全なモデルウェイトを7月27日までに公開し、同時期に技術レポートも提供すると予告しています。それらの成果物と最終ライセンスが公開されるまでは、「オープン」はダウンロード可能な本番資産ではなく、発表された到達点を指す言葉です。

この規模では、オープンウェイトの意味も変わります。2.8兆パラメータの場合、実行時のオーバーヘッド、キャッシュ、アクティベーション、冗長化を含める前でも、生のウェイトはパラメータあたり4 bitsで約1.4 TB、16 bitsで約5.6 TBを占めます。Kimiは64基以上のアクセラレーターを備えたスーパーノード構成を推奨しています。

これはワークステーション向けモデルではなく、データセンター規模のインフラです。個人の技術系開発者ならAPIを利用すべきです。プライベート推論を検討する中堅企業は、セルフホスティングを節約策とみなす前に、クラスター、ネットワーク、運用担当者、余剰キャパシティの費用を見積もる必要があります。

3つの違いを押さえてください。

  • オープンウェイトとは、学習済みパラメータをダウンロードできること。
  • オープンソースには、目的の用途を許可するコードとライセンス条件も必要。
  • 現実的なセルフホスティングとは、継続可能なインフラと運用予算にモデルが収まること。

現在のオープンウェイトモデル事情には、すでに導入しやすい小型モデルが含まれています。K3も性能面の最前線に加わる可能性はありますが、まずリリースファイルとライセンスが公開されなければなりません。

Kimi K3、GPT-5.6 Sol、Claude Fable 5はどう選ぶべきか

最も良いベンチマーク項目ではなく、失敗時の損失で選びます。

状況選択理由見送る条件
コーディングエージェントが大規模で安定したリポジトリを繰り返し読むKimi K3を試す自動キャッシュと$0.30のキャッシュ入力により、長時間セッションを経済的に運用できるランタイムが完全な思考履歴を保持できない
本番エージェントに幅広く成熟したツールと難しい判断が必要GPT-5.6 Sol高い総合力、成熟したWeb・コンピューターツール、現行の本番向け環境出力料金が支出の中心で、自社ルートではK3が同等の品質を出せる
判断力が価格より重要な、影響の大きい数日間のタスクClaude Fable 5意欲的な長時間作業と検証を想定して設計されている$50の出力料金を修正回数の削減で回収できない
管理下のインフラからデータを出せない待つか、別のオープンモデルを選ぶK3のウェイトと最終ライセンスが未公開評価期間中はAPIを利用できる
大量の単純処理で低遅延・低推論コストが必要どのフラッグシップも原則選ばないK3は推論強度がmaxのみで、SolとFableもプレミアムなルート実測した失敗率から、フラッグシップの費用対効果が証明できる

Kimi K3は価格性能を確かめる候補

長いコンテキスト、キャッシュを使ったリポジトリ作業、ネイティブ画像理解が実際の処理で優位になるなら、Kimi K3は試す価値があります。100万トークンあたり入力$3、キャッシュ入力$0.30、出力$15なので、多少効率で劣ってもコスト面で最先端モデルを上回る余地があります。セッション層が履歴を保持できない場合、公式Web検索が中核になる場合、先走ったアクションが高くつく場合は見送るべきです。

GPT-5.6 Solは打ち負かすべき本番デフォルト

GPT-5.6 Solは、成熟したツール群と、さまざまな処理で実証された挙動が必要なルートでは、より堅実なデフォルトです。function calling、構造化出力、Web・file search、code execution、hosted shell、computer use、MCP、tool searchに対応しています。料金は入力$5、キャッシュ入力$0.50、出力$30とK3より高いものの、レビュー負担が軽くなれば追加料金を正当化できます。現在のGPT-5.6ルーティングガイドでは、Sol、Terra、Lunaにどのように作業を分けるべきかを解説しています。

Sol、Terra、Lunaを紹介するOpenAI GPT-5.6の発表ページ
GPT-5.6 Sol

安定して繰り返せるルートで、K3が同じ水準の採用可能な成果を出せるなら、Solを見送ります。安いモデルが評価に合格した後も最先端モデルの追加料金を払い続けるのは、リスク管理ではなく習慣です。

Claude Fable 5は判断力への追加投資

Claude Fable 5は、大規模なコーディングやナレッジワーク向けとして、Anthropicが一般提供している最も高性能なモデルです。100万トークンあたり入力$10、出力$50で、入力には90%のプロンプトキャッシュ割引があります。Anthropicは、計画、委任、テスト、自己点検を行う長期プロジェクト向けと位置付けています。

Anthropic Claude Fable 5の製品・料金ページ
Claude Fable 5

障壁は料金とルーティングの予測しやすさです。機微なサイバーセキュリティや生物学のリクエストでは、Opus 4.8にフォールバックすることがあります。修正回数の削減、より良い判断、より長く安定した自律処理によってK3やSol以上の採用可能な成果を生み出せる場合に限り、Fableの追加料金には価値があります。

元に戻せるKimi K3評価プラン

K3を安全に採用するには、一度に1つのルートだけを変更し、従来のモデルへ戻せる状態を保ちます。モデルのローンチは依存関係のアップグレードと同様に扱うべきです。観測可能で、元に戻せて、原因を特定できるほど範囲を絞る必要があります。

セッションとツールのリスク警告を含む4段階のKimi K3本番評価ゲート
K3に本番ルートを任せる前に、履歴、権限、成果の各ゲートを通過させます。
  1. 高コストなルートを1つ選ぶ

    SolやFableのコストが無視できず、K3に優位性がありそうな作業から始めます。たとえば、リポジトリ規模のデバッグ、長文ドキュメント分析、画像を使ったフロントエンド修正です。プロダクト内のすべてのAI呼び出しから始めてはいけません。

  2. 比較条件を固定する

    同じプロンプト、ファイル、ツール、権限境界、合格基準を使います。可能な限りエージェントのランタイムも固定し、モデルの違いとツールの違いを混同しないようにします。

  3. 新規セッションで始め、履歴を保持する

    K3用の新しいセッションを作り、APIが必要とするアシスタントの思考履歴をすべて保持し、安定したプレフィックスはキャッシュにヒットするようバイト単位で一貫させます。進行中のセッションを別モデルからK3へ切り替えてはいけません。

  4. モデル外でアクションを制限する

    ツールを許可リストで限定し、外部への書き込みや破壊的変更には承認を必須とし、支出に上限を設け、ロールバックを確保します。境界はシステムプロンプトだけでなく、コードと権限で設定します。

  5. 採用できた成果を測る

    入力、キャッシュ入力、出力、経過時間、再試行、却下した成果、レビュー工数を記録します。総支出を採用できた成果数で割ってください。K3の低料金と出力が長くなりやすい傾向を、1つの指標に反映できます。

  6. K3が勝ったルートだけを移行する

    品質基準を満たし、総コストが下がったルートだけを移します。難しいケースではSolまたはFableへ明示的にエスカレーションできるようにし、単純な大量処理はより安いモデルに残します。

このプランで、K3が一般論として優れていると信じる必要はありません。1つの仕事でK3のほうが優れていると証明すれば十分です。本番環境のモデル選定が長く正しい状態を保てるのは、この粒度だけです。

Kimi K3とは何ですか?

Kimi K3は、長時間のコーディング、ナレッジワーク、推論に向けたMoonshot AIの2.8兆パラメータのフラッグシップモデルです。テキストと画像を受け付け、1,048,576トークンのコンテキストを備え、Kimiのアプリ、コーディングツール、APIから利用できます。

Kimi K3はオープンソースになりますか?

Kimiは、完全なモデルウェイトを2026年7月27日までに公開するとしています。7月17日時点では、ウェイト、最終ライセンス、技術レポートが未公開なので、商用利用権と再現可能なセルフホスティングは、それらが公開されてから評価すべきです。

Kimi AIをローカルで実行できますか?

K3は一般的なローカルモデルではありません。2.8兆パラメータのウェイトは、実行時のオーバーヘッドを除いても、パラメータあたり4 bitsで約1.4 TBになります。Kimiは64基以上のacceleratorを備えたsupernodeを推奨しています。ほとんどのチームはAPI経由でK3を評価すべきです。

Kimiは完全に無料ですか?

いいえ。Adagioメンバーシップは無料で6 Agent creditsが含まれますが、Kimi Code creditsはありません。有料メンバーシップはModeratoの月額$19からで、Kimi APIは入力・出力トークンに応じて別途課金されます。

Kimi K3はGPT-5.6 SolやClaude Fable 5より優れていますか?

総合的には違います。ベンダー公表値の一部ではK3が首位で、料金も安い一方、Kimi自身は総合力でSolとFableにまだ及ばないとしています。実務で問うべきなのは、自社ルートの合格基準をK3がより低い総コストで満たせるかどうかです。

実際の業務に合う最新モデルを知りたい方へ。ビジネスオーナー向けAIツールマップを無料でお届けします。

最終更新

2026年9月3日

カテゴリーAI

Googleでこのサイトを優先する

omidsaffari.comをGoogle検索の優先ソースに追加

omidsaffari.comを優先ソースに設定すると、GoogleがTop Stories・AI Overviews・AI Modeであなたのために優先表示します。

ニュースレター

毎週日曜、一通の手紙。 動くシステムの話。感想戦ではなく。

AIベンチャーのポートフォリオ運営から生まれるビルドログ、稼働中のシステム、現場ノート。

週刊。スパムなし。いつでも解除できます。